{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:PTY7WWJOJMOMKRFCE2LHBAZJ6G","short_pith_number":"pith:PTY7WWJO","schema_version":"1.0","canonical_sha256":"7cf1fb592e4b1cc544a22696708329f1bb9a5106fd4fbe5bbfe1da3da741e63c","source":{"kind":"arxiv","id":"2506.14731","version":2},"attestation_state":"computed","paper":{"title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Bin Hu, Cai Chen, Deng Zhao, Ding Liu, Dingnan Jin, Feng Zhu, Hao Dai, Hongzhi Luan, Jia Guo, Jiaming Liu, Jiewei Wu, Junbo Zhao, Jun Mei, Junwu Xiong, Jun Zhou, Kaihong Zhang, Kuan Xu, Lei Liang, Liangcheng Fu, Liang Jiang, Ling Team, Longfei Zheng, Qiang Gao, Qing Cui, Quan Wan, Shaomian Zheng, Shuaicheng Li, Tongkai Yang, Wang Ren, Xiaodong Yan, Xiaopei Wan, Xiaoyun Feng, Xinxing Yang, Xinyu Kong, Xin Zhao, Xuemin Yang, Yang Li, Yingting Wu, Yongkang Liu, Zhankai Xu, Zhenduo Zhang, Zhenglei Zhou, Zhenyu Huang, Zhiqiang Zhang, Zihao Wang, Zujie Wen","submitted_at":"2025-06-17T17:12:34Z","abstract_excerpt":"We present Ring-lite, a Mixture-of-Experts (MoE)-based large language model optimized via reinforcement learning (RL) to achieve efficient and robust reasoning capabilities. Built upon the publicly available Ling-lite model, a 16.8 billion parameter model with 2.75 billion activated parameters, our approach matches the performance of state-of-the-art (SOTA) small-scale reasoning models on challenging benchmarks (e.g., AIME, LiveCodeBench, GPQA-Diamond) while activating only one-third of the parameters required by comparable models. To accomplish this, we introduce a joint training pipeline int"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.14731","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-06-17T17:12:34Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"05b2b7c2b9da086e261e75d65111f871f4cc159e59c84e530f72b9f7f6aac22d","abstract_canon_sha256":"5928a2bd4f5dc7ad21c19f38930429743594d04c280cde9f058668ad21f5ddf3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:23:31.202301Z","signature_b64":"8rdGakGJICYUpS+0R6hz5X8qywnwpDX+i99wVcmO76YWhiL4YT/v0gc3CJaEj62peYFsfF4UHMmdHu/bK2e/Ag==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7cf1fb592e4b1cc544a22696708329f1bb9a5106fd4fbe5bbfe1da3da741e63c","last_reissued_at":"2026-07-05T11:23:31.201806Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:23:31.201806Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Bin Hu, Cai Chen, Deng Zhao, Ding Liu, Dingnan Jin, Feng Zhu, Hao Dai, Hongzhi Luan, Jia Guo, Jiaming Liu, Jiewei Wu, Junbo Zhao, Jun Mei, Junwu Xiong, Jun Zhou, Kaihong Zhang, Kuan Xu, Lei Liang, Liangcheng Fu, Liang Jiang, Ling Team, Longfei Zheng, Qiang Gao, Qing Cui, Quan Wan, Shaomian Zheng, Shuaicheng Li, Tongkai Yang, Wang Ren, Xiaodong Yan, Xiaopei Wan, Xiaoyun Feng, Xinxing Yang, Xinyu Kong, Xin Zhao, Xuemin Yang, Yang Li, Yingting Wu, Yongkang Liu, Zhankai Xu, Zhenduo Zhang, Zhenglei Zhou, Zhenyu Huang, Zhiqiang Zhang, Zihao Wang, Zujie Wen","submitted_at":"2025-06-17T17:12:34Z","abstract_excerpt":"We present Ring-lite, a Mixture-of-Experts (MoE)-based large language model optimized via reinforcement learning (RL) to achieve efficient and robust reasoning capabilities. Built upon the publicly available Ling-lite model, a 16.8 billion parameter model with 2.75 billion activated parameters, our approach matches the performance of state-of-the-art (SOTA) small-scale reasoning models on challenging benchmarks (e.g., AIME, LiveCodeBench, GPQA-Diamond) while activating only one-third of the parameters required by comparable models. To accomplish this, we introduce a joint training pipeline int"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.14731","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.14731/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.14731","created_at":"2026-07-05T11:23:31.201864+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.14731v2","created_at":"2026-07-05T11:23:31.201864+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.14731","created_at":"2026-07-05T11:23:31.201864+00:00"},{"alias_kind":"pith_short_12","alias_value":"PTY7WWJOJMOM","created_at":"2026-07-05T11:23:31.201864+00:00"},{"alias_kind":"pith_short_16","alias_value":"PTY7WWJOJMOMKRFC","created_at":"2026-07-05T11:23:31.201864+00:00"},{"alias_kind":"pith_short_8","alias_value":"PTY7WWJO","created_at":"2026-07-05T11:23:31.201864+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2512.05591","citing_title":"Entropy Ratio Clipping as a Soft Global Constraint for Stable Reinforcement Learning","ref_index":19,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G","json":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G.json","graph_json":"https://pith.science/api/pith-number/PTY7WWJOJMOMKRFCE2LHBAZJ6G/graph.json","events_json":"https://pith.science/api/pith-number/PTY7WWJOJMOMKRFCE2LHBAZJ6G/events.json","paper":"https://pith.science/paper/PTY7WWJO"},"agent_actions":{"view_html":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G","download_json":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G.json","view_paper":"https://pith.science/paper/PTY7WWJO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.14731&json=true","fetch_graph":"https://pith.science/api/pith-number/PTY7WWJOJMOMKRFCE2LHBAZJ6G/graph.json","fetch_events":"https://pith.science/api/pith-number/PTY7WWJOJMOMKRFCE2LHBAZJ6G/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G/action/storage_attestation","attest_author":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G/action/author_attestation","sign_citation":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G/action/citation_signature","submit_replication":"https://pith.science/pith/PTY7WWJOJMOMKRFCE2LHBAZJ6G/action/replication_record"}},"created_at":"2026-07-05T11:23:31.201864+00:00","updated_at":"2026-07-05T11:23:31.201864+00:00"}