{"as_of":"2026-08-11T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d8da70b1e257b9cad48b7b7c22a64b0bdc205d88c59987f960328ecca981a09","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:44.311377Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:04:38.759385Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:58:53.662557Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15758","snapshot_observed_at":"2026-08-05T17:04:38.759385Z","title":"Lapo: Internalizing reasoning efficiency via length-adaptive policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-06T13:40:01.864747Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T17:04:38.759385Z"},"links":{"cited_paper":"/paper/2507.15758","citing_paper":"/paper/2508.17196"},"observation_digest":"sha256:8e56804d51f40aa983f61602c158fffb6d7b8d9a0b53d443c92e04704b58820e","observation_id":"2fe9cc27-c640-41c8-b2d0-218cc82279ba","resolution":{"observed_at":"2026-08-05T17:04:38.759385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.15758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15758","snapshot_observed_at":"2026-07-03T19:58:53.662557Z","title":"Lapo: Internal- izing reasoning efficiency via length-adaptive policy opti- mization.arXiv:2507.15758","venue":null,"work_id":"067dec86-8688-4cbe-adcd-b713b309bbd5","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-08-10T21:18:12.751614Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2507.15758","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:e14f810a96933f65c0ade25267284371aa1e26ae2e0c14e141d36d6004a7a4d8","observation_id":"79333e2d-250d-4ace-aee3-0a39cbf8206b","resolution":{"observed_at":"2026-05-11T05:21:00.059202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.15758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15758","snapshot_observed_at":"2026-07-03T19:58:53.662557Z","title":"Lapo: Internal- izing reasoning efficiency via length-adaptive policy opti- mization.arXiv:2507.15758","venue":null,"work_id":"067dec86-8688-4cbe-adcd-b713b309bbd5","year":2025},"citing_paper":{"arxiv_id":"2607.01518","last_updated":"2026-07-01T22:31:10Z","snapshot_observed_at":"2026-08-06T19:26:37.371608Z","submitted_at":"2026-07-01T22:31:10Z","title":"Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-03T19:52:11.018335Z"},"links":{"cited_paper":"/paper/2507.15758","citing_paper":"/paper/2607.01518"},"observation_digest":"sha256:6b3a59ab1beaf8000c7850dac09b8bae77de7db9a32f71ed9fb2468473f606ae","observation_id":"66042c5c-5030-4a85-830e-16688a93f121","resolution":{"observed_at":"2026-07-03T19:58:53.664207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15758/citation-record","integrity":"/paper/2507.15758/integrity","json":"/paper/2507.15758/citation-record.json","paper":"/paper/2507.15758"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T15:29:42.182628Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.182628Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:3e151d165b8feba2a134dc57595825de14107dbc1b6cfb7a5172e74f551ab260","observation_id":"63efb1d1-3055-422a-bacc-3f2a525f4774","resolution":{"observed_at":"2026-08-06T15:29:42.182628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-08T22:27:57.440955Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-06T15:29:42.379745Z","title":"Thinkless: Llm learns when to think.arXiv preprint arXiv:2505.13379, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.379745Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:b0a5a9d741bda6899cb6c817d0dfbc51910329b61a241ba3ea6f067ad3f140bc","observation_id":"0c2ae177-ebe1-478c-a172-115c2560f6d9","resolution":{"observed_at":"2026-08-06T15:29:42.379745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:29:42.446317Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.446317Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:9f3fe5d90894ab39f9a720aab3bb937dff5d59f79c52de468793a057f710da5e","observation_id":"fc79b765-1550-4f56-949e-23c0b32a0c8c","resolution":{"observed_at":"2026-08-06T15:29:42.446317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-11T04:38:08.656962Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-06T15:29:42.490719Z","title":"Token- budget-aware llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.490719Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:33ff9b152ece35b6ba31a8932aa9d3099da5fb644cf85503497ec4a9fab73b34","observation_id":"615c17f0-de06-40d5-aa00-90439ad8af3b","resolution":{"observed_at":"2026-08-06T15:29:42.490719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T15:29:42.574658Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.574658Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:fe8bac3f28c4061a36daf7aa88368eb45fe71fb141634069e9fdf935e5dbca70","observation_id":"3b866691-815f-4263-bdb7-5c74eda232b8","resolution":{"observed_at":"2026-08-06T15:29:42.574658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T15:29:42.642768Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.642768Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:6befebdc0eb6363734506ffab73349d6c84d777d2300af2b04bccf7191974dda","observation_id":"ffc127bb-2f9d-4e59-97fc-161b990fc451","resolution":{"observed_at":"2026-08-06T15:29:42.642768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.11225","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Hapo: Training language models to reason concisely via history-aware policy optimization","venue":"ArXiv.org","work_id":"81ad9735-2caf-464a-919e-e2e16ae442f0","year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.818923Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:6025243f64c0b87d1e5b9481e06f3d4e5346ac4b5ae94375137206ca9e68a59c","observation_id":"3c80df40-f92a-4d48-9390-0400681285f8","resolution":{"observed_at":"2026-08-06T15:29:44.660422Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:42.907541Z","title":"Overthink: Slowdown attacks on reasoning llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.907541Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:ca35f16779e3d1e7062c9ec684356a38a4fa2e6fa7a37367d5532893a4158951","observation_id":"5628c428-fb7c-4db6-843d-608cd7a3b9a0","resolution":{"observed_at":"2026-08-06T15:29:42.907541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-06T15:29:42.965888Z","title":"Adacot: Pareto-optimal adaptive chain-of-thought triggering via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.965888Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:5f8caca2cd47658bef60f918fead02b66f855dbbc39d5200d3ae8cc889d76c19","observation_id":"40826666-312f-482b-9b61-0a3ca07a52ce","resolution":{"observed_at":"2026-08-06T15:29:42.965888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-06T15:29:43.034909Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.034909Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:b1b768f85ec95e99d75f250b026a5462ecf98353f2c42550dade63aade7aa224","observation_id":"4e7f71cc-cee9-4d46-84ad-e4eb1a61b23c","resolution":{"observed_at":"2026-08-06T15:29:43.034909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-06T15:29:43.103227Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.103227Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:382f275a616a3c6b5d623292220572741b786c3bf76ca9fe7541a4d9698ab2f9","observation_id":"031ce5b9-3f8a-48e5-a7ff-64797412ca69","resolution":{"observed_at":"2026-08-06T15:29:43.103227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:29:43.152143Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.152143Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:0919f3c353688e6cbee05891fee8aa6ece0747a496418eb1fc52c6f9d3e5ab69","observation_id":"fe021649-68fc-4f31-969b-6cb2d99e2b6e","resolution":{"observed_at":"2026-08-06T15:29:43.152143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-06T15:29:43.237643Z","title":"Routellm: Learning to route llms with preference data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.237643Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:77607a1e8414b5435521488ae4e63cbda54eff640bd9fe0d8529301425c3eeb5","observation_id":"1ca9559b-1e6c-4fd5-938d-e6263e64c308","resolution":{"observed_at":"2026-08-06T15:29:43.237643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:43.338210Z","title":"Concise: Confidence-guided compression in step-by-step efficient reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.338210Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:23d2db50fa1b13ad9d83ec3218deb6f24fef965b74d6f4342e9c5c4ca33e3c46","observation_id":"bd09387e-8315-438e-b042-0a555fa54d84","resolution":{"observed_at":"2026-08-06T15:29:43.338210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T15:29:43.402800Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.402800Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:2d3d80002b7abaf54104dffc5ce4551eb255baebeeaec99423a8e59efbda3aa9","observation_id":"64582e5a-def5-485d-9a17-831dec3742b0","resolution":{"observed_at":"2026-08-06T15:29:43.402800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-06T15:29:43.470138Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.470138Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:8adc5b9de426650458acebddd9a6282604c9b8b8c3ecaf4e5c10d09c364bad05","observation_id":"16de9413-fb86-45b2-9678-08447fd5fd0d","resolution":{"observed_at":"2026-08-06T15:29:43.470138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:43.549175Z","title":"Learning when to think: Shaping adaptive reasoning in r1-style models via multi-stage rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.549175Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:01cf840c7c9d44de52e289d7e3a52808e1ca6dd54d0c94909bf4ee8ebff98137","observation_id":"970106e8-2575-4f0f-b7b5-89e0db836bf9","resolution":{"observed_at":"2026-08-06T15:29:43.549175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T15:29:43.658272Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.658272Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:544660dc04b57ed9522c152847a79cec1342716faf8a0f5b993780c45852bad1","observation_id":"d5d660cd-42a0-4987-9d75-5cd43b6ef237","resolution":{"observed_at":"2026-08-06T15:29:43.658272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16838","last_updated":"2024-11-20T17:57:26Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:45:59Z","title":"From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16838","snapshot_observed_at":"2026-08-06T15:29:43.802572Z","title":"From decoding to meta-generation: Inference-time algorithms for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.802572Z"},"links":{"cited_paper":"/paper/2406.16838","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:03e8f481fdbcef08f170cffa8feac2097e0341c2a137db62b5c714492935e78d","observation_id":"88529ffc-21a4-4fa3-a5bc-debeba036124","resolution":{"observed_at":"2026-08-06T15:29:43.802572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-06T15:29:43.891579Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.891579Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:670238ce9b6a9898ace26e02c4412620a62831060e8fbcce41232f3ff7e1a7a4","observation_id":"2f248839-594e-4aa9-a5cc-a8be95e04fe2","resolution":{"observed_at":"2026-08-06T15:29:43.891579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:43.955617Z","title":"Tokenskip: Controllable chain-of-thought compression in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.955617Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:0abda284cc903f8485a729cdeb1b8b8692d3ab8154b2909216a0a9386bf3b91a","observation_id":"63e39cad-253f-40a9-9eae-35936d284e34","resolution":{"observed_at":"2026-08-06T15:29:43.955617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18600","last_updated":"2025-03-03T17:08:21Z","snapshot_observed_at":"2026-08-07T17:49:06.764625Z","submitted_at":"2025-02-25T19:36:06Z","title":"Chain of Draft: Thinking Faster by Writing Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18600","snapshot_observed_at":"2026-08-06T15:29:44.051838Z","title":"Chain of draft: Thinking faster by writing less","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:44.051838Z"},"links":{"cited_paper":"/paper/2502.18600","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:8c553b4a3e2af19ba45d6366e4a5ce9889127756e6fd3100c6e1ecadf99c45fb","observation_id":"fdba8db0-4a46-44b5-93ec-e6e4ed21c265","resolution":{"observed_at":"2026-08-06T15:29:44.051838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-07T15:42:59.701048Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-06T15:29:44.311377Z","title":"Adaptthink: Reasoning models can learn when to think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:44.311377Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:fc1aa2c35b4124c10b4cbf07c33c33b87002a7cbbd9fdedab8d5376b71a04d3d","observation_id":"1a6ea9b0-bdc5-43fc-a0ff-04b2443f1d8b","resolution":{"observed_at":"2026-08-06T15:29:44.311377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-06T15:29:42.735481Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.735481Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:07bd847bd2cd8c56a3573f7428ba561397e3fffaf5d80fbea90a5904b7ac45a7","observation_id":"429ce97d-9577-489b-b6e0-91645c229703","resolution":{"observed_at":"2026-08-06T15:29:42.735481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-08-09T22:51:48.255703Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-06T15:29:43.738162Z","title":"Thoughts are all over the place: On the underthinking of o1-like llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.738162Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:59c3bcbae56024d1cfc6a48b6c46e6c680adb5b95435d4df6d64d0c5a43ec89f","observation_id":"e228e5ed-4276-4971-b943-3801b8bf9c36","resolution":{"observed_at":"2026-08-06T15:29:43.738162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T15:29:44.153200Z","title":"Demystifying long chain- of-thought reasoning in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:44.153200Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:8d433b7a28f942c27af396d4b342286b3fc8623310ad86b7d16fc505762111c8","observation_id":"4002c37a-0be0-465f-ae43-b3bb56358af2","resolution":{"observed_at":"2026-08-06T15:29:44.153200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13284","last_updated":"2025-06-19T22:52:45Z","snapshot_observed_at":"2026-08-07T19:53:57.315695Z","submitted_at":"2024-10-17T07:28:18Z","title":"Learning to Route LLMs with Confidence Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13284","snapshot_observed_at":"2026-08-06T15:29:42.324127Z","title":"Learning to route llms with confidence tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.324127Z"},"links":{"cited_paper":"/paper/2410.13284","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:821de68745cf29686e3b0c1e5a64e3bbf98a47933b621f4178ec4ae3e038004f","observation_id":"68ca42b8-4c01-42fa-b60b-a0580f4d084d","resolution":{"observed_at":"2026-08-06T15:29:42.324127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T15:29:42.254233Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.254233Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:9ca6222844e4d173964d4d09c65202130981e6ee282a8200b348ccb97051ec4d","observation_id":"7167743f-36ee-4791-80e2-9212c2d9a929","resolution":{"observed_at":"2026-08-06T15:29:42.254233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T23:39:24.870322Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2507.15758."}