{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:DFEP5TKPF3SKK2PJC5RZCZAEQF","short_pith_number":"pith:DFEP5TKP","schema_version":"1.0","canonical_sha256":"1948fecd4f2ee4a569e917639164048147f79bae94987760ebd7473c6fc7518a","source":{"kind":"arxiv","id":"2504.16891","version":1},"attestation_state":"computed","paper":{"title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Benedikt Schifferer, Christof Henkel, Darragh Hanley, Igor Gitman, Ivan Moshkov, Ivan Sorokin, Shubham Toshniwal, Wei Du","submitted_at":"2025-04-23T17:13:04Z","abstract_excerpt":"This paper presents our winning submission to the AI Mathematical Olympiad - Progress Prize 2 (AIMO-2) competition. Our recipe for building state-of-the-art mathematical reasoning models relies on three key pillars. First, we create a large-scale dataset comprising 540K unique high-quality math problems, including olympiad-level problems, and their 3.2M long-reasoning solutions. Second, we develop a novel method to integrate code execution with long reasoning models through iterative training, generation, and quality filtering, resulting in 1.7M high-quality Tool-Integrated Reasoning solutions"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.16891","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-04-23T17:13:04Z","cross_cats_sorted":["cs.CL","cs.LG"],"title_canon_sha256":"cf119b255ebbb60f8c776a2e83b45104c52a8544078ead3025e6f7cca830b3a1","abstract_canon_sha256":"bf342391d0e1b7065d14e75c2c8dab0e02d0f6ff830133cbe427723c8926482f"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:53:06.054093Z","signature_b64":"gGf73OmYVHKTDrl76V9VIoSMkqjky7QNcgKWLGp8NeH7PXt/mGCMl6YydTS0yob9b6WPILUZrcDgSna+4V/mBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1948fecd4f2ee4a569e917639164048147f79bae94987760ebd7473c6fc7518a","last_reissued_at":"2026-07-05T10:53:06.053603Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:53:06.053603Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.LG"],"primary_cat":"cs.AI","authors_text":"Benedikt Schifferer, Christof Henkel, Darragh Hanley, Igor Gitman, Ivan Moshkov, Ivan Sorokin, Shubham Toshniwal, Wei Du","submitted_at":"2025-04-23T17:13:04Z","abstract_excerpt":"This paper presents our winning submission to the AI Mathematical Olympiad - Progress Prize 2 (AIMO-2) competition. Our recipe for building state-of-the-art mathematical reasoning models relies on three key pillars. First, we create a large-scale dataset comprising 540K unique high-quality math problems, including olympiad-level problems, and their 3.2M long-reasoning solutions. Second, we develop a novel method to integrate code execution with long reasoning models through iterative training, generation, and quality filtering, resulting in 1.7M high-quality Tool-Integrated Reasoning solutions"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.16891","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.16891/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.16891","created_at":"2026-07-05T10:53:06.053665+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.16891v1","created_at":"2026-07-05T10:53:06.053665+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.16891","created_at":"2026-07-05T10:53:06.053665+00:00"},{"alias_kind":"pith_short_12","alias_value":"DFEP5TKPF3SK","created_at":"2026-07-05T10:53:06.053665+00:00"},{"alias_kind":"pith_short_16","alias_value":"DFEP5TKPF3SKK2PJ","created_at":"2026-07-05T10:53:06.053665+00:00"},{"alias_kind":"pith_short_8","alias_value":"DFEP5TKP","created_at":"2026-07-05T10:53:06.053665+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":30,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.05394","citing_title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","ref_index":20,"is_internal_anchor":true},{"citing_arxiv_id":"2606.21974","citing_title":"Fine-Tuning Large Language Models for Quantum Reasoning","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01490","citing_title":"Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11719","citing_title":"Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14531","citing_title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14392","citing_title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29424","citing_title":"EntroRouter: Learning Efficient Model Routing via Entropy Regulation","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25381","citing_title":"Not only where, But when: Temporal Scheduling for RLVR","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27709","citing_title":"ReverseMath: Answer Inversion for Scalable and Verifiable Mathematical Problem Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28751","citing_title":"Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05688","citing_title":"Value-and-Structure Alignment for Routing-Consistent Quantization of Mixture-of-Experts Models","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22389","citing_title":"Unified Data Selection for LLM Reasoning","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14531","citing_title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2505.24187","citing_title":"Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Models","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2509.00084","citing_title":"Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2510.04265","citing_title":"Don't Pass@k: A Bayesian Framework for Large Language Model Evaluation","ref_index":92,"is_internal_anchor":false},{"citing_arxiv_id":"2504.11456","citing_title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2602.14868","citing_title":"Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14531","citing_title":"Language Generation as Optimal Control: Closed-Loop Diffusion in Latent Control Space","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09100","citing_title":"GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2503.24290","citing_title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09100","citing_title":"GRC: Unifying Reasoning-Driven Generation, Retrieval and Compression","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07237","citing_title":"Teaching Language Models to Think in Code","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06660","citing_title":"Verifier-Backed Hard Problem Generation for Mathematical Reasoning","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19087","citing_title":"OLLM: Options-based Large Language Models","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF","json":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF.json","graph_json":"https://pith.science/api/pith-number/DFEP5TKPF3SKK2PJC5RZCZAEQF/graph.json","events_json":"https://pith.science/api/pith-number/DFEP5TKPF3SKK2PJC5RZCZAEQF/events.json","paper":"https://pith.science/paper/DFEP5TKP"},"agent_actions":{"view_html":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF","download_json":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF.json","view_paper":"https://pith.science/paper/DFEP5TKP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.16891&json=true","fetch_graph":"https://pith.science/api/pith-number/DFEP5TKPF3SKK2PJC5RZCZAEQF/graph.json","fetch_events":"https://pith.science/api/pith-number/DFEP5TKPF3SKK2PJC5RZCZAEQF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF/action/storage_attestation","attest_author":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF/action/author_attestation","sign_citation":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF/action/citation_signature","submit_replication":"https://pith.science/pith/DFEP5TKPF3SKK2PJC5RZCZAEQF/action/replication_record"}},"created_at":"2026-07-05T10:53:06.053665+00:00","updated_at":"2026-07-05T10:53:06.053665+00:00"}