{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:MF7YEAFRVPMQWV4HKIIUGPTXCM","short_pith_number":"pith:MF7YEAFR","schema_version":"1.0","canonical_sha256":"617f8200b1abd90b57875211433e77132c000a142be880b10f96921f132c5fa8","source":{"kind":"arxiv","id":"2502.06703","version":1},"attestation_state":"computed","paper":{"title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Biqing Qi, Bowen Zhou, Jian Zhao, Junqi Gao, Kaiyan Zhang, Runze Liu, Wanli Ouyang, Xiu Li","submitted_at":"2025-02-10T17:30:23Z","abstract_excerpt":"Test-Time Scaling (TTS) is an important method for improving the performance of Large Language Models (LLMs) by using additional computation during the inference phase. However, current studies do not systematically analyze how policy models, Process Reward Models (PRMs), and problem difficulty influence TTS. This lack of analysis limits the understanding and practical use of TTS methods. In this paper, we focus on two core questions: (1) What is the optimal approach to scale test-time computation across different policy models, PRMs, and problem difficulty levels? (2) To what extent can exten"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.06703","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-02-10T17:30:23Z","cross_cats_sorted":[],"title_canon_sha256":"1af77f65c0c047fd66a276758900bd927e4fbc22142302dbc4faa9842bef0ad4","abstract_canon_sha256":"71f7dc90909a1fa48b679db5406716647edae3c0ae0e5aa4d9c66b843bf07c09"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:12:11.042736Z","signature_b64":"AiijkUHOKRGzi49N7MKnzUjMEROEslo0Y6A3WvTdGaYKVkbUAwnfQiAUmfDTcbpwM114MT2SayFuOpEZfBxLCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"617f8200b1abd90b57875211433e77132c000a142be880b10f96921f132c5fa8","last_reissued_at":"2026-07-05T10:12:11.042266Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:12:11.042266Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Biqing Qi, Bowen Zhou, Jian Zhao, Junqi Gao, Kaiyan Zhang, Runze Liu, Wanli Ouyang, Xiu Li","submitted_at":"2025-02-10T17:30:23Z","abstract_excerpt":"Test-Time Scaling (TTS) is an important method for improving the performance of Large Language Models (LLMs) by using additional computation during the inference phase. However, current studies do not systematically analyze how policy models, Process Reward Models (PRMs), and problem difficulty influence TTS. This lack of analysis limits the understanding and practical use of TTS methods. In this paper, we focus on two core questions: (1) What is the optimal approach to scale test-time computation across different policy models, PRMs, and problem difficulty levels? (2) To what extent can exten"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.06703","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.06703/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.06703","created_at":"2026-07-05T10:12:11.042326+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.06703v1","created_at":"2026-07-05T10:12:11.042326+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.06703","created_at":"2026-07-05T10:12:11.042326+00:00"},{"alias_kind":"pith_short_12","alias_value":"MF7YEAFRVPMQ","created_at":"2026-07-05T10:12:11.042326+00:00"},{"alias_kind":"pith_short_16","alias_value":"MF7YEAFRVPMQWV4H","created_at":"2026-07-05T10:12:11.042326+00:00"},{"alias_kind":"pith_short_8","alias_value":"MF7YEAFR","created_at":"2026-07-05T10:12:11.042326+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":23,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26091","citing_title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23611","citing_title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09932","citing_title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","ref_index":117,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":115,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24198","citing_title":"Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28661","citing_title":"When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2603.16331","citing_title":"Decoding the Critique Mechanism in Large Reasoning Models","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2507.15778","citing_title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2510.06062","citing_title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2503.17352","citing_title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2508.15202","citing_title":"Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2509.13332","citing_title":"Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2601.21684","citing_title":"Do Not Waste Your Rollouts: Recycling Search Experience for Efficient Test-Time Scaling","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10195","citing_title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10195","citing_title":"Breaking the Reward Barrier: Accelerating Tree-of-Thought Reasoning via Speculative Exploration","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10158","citing_title":"Unsupervised Process Reward Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24198","citing_title":"Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02290","citing_title":"Distilling Long-CoT Reasoning through Collaborative Step-wise Multi-Teacher Decoding","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08057","citing_title":"CA-SQL: Complexity-Aware Inference Time Reasoning for Text-to-SQL via Exploration and Compute Budget Allocation","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04750","citing_title":"DeepStack: Scalable and Accurate Design Space Exploration for Distributed 3D-Stacked AI Accelerators","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14853","citing_title":"Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15239","citing_title":"TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04461","citing_title":"Stream-T1: Test-Time Scaling for Streaming Video Generation","ref_index":24,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM","json":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM.json","graph_json":"https://pith.science/api/pith-number/MF7YEAFRVPMQWV4HKIIUGPTXCM/graph.json","events_json":"https://pith.science/api/pith-number/MF7YEAFRVPMQWV4HKIIUGPTXCM/events.json","paper":"https://pith.science/paper/MF7YEAFR"},"agent_actions":{"view_html":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM","download_json":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM.json","view_paper":"https://pith.science/paper/MF7YEAFR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.06703&json=true","fetch_graph":"https://pith.science/api/pith-number/MF7YEAFRVPMQWV4HKIIUGPTXCM/graph.json","fetch_events":"https://pith.science/api/pith-number/MF7YEAFRVPMQWV4HKIIUGPTXCM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM/action/storage_attestation","attest_author":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM/action/author_attestation","sign_citation":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM/action/citation_signature","submit_replication":"https://pith.science/pith/MF7YEAFRVPMQWV4HKIIUGPTXCM/action/replication_record"}},"created_at":"2026-07-05T10:12:11.042326+00:00","updated_at":"2026-07-05T10:12:11.042326+00:00"}