{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:JXUTRQVTPCDJU6R6X7VZA4PWPH","short_pith_number":"pith:JXUTRQVT","schema_version":"1.0","canonical_sha256":"4de938c2b378869a7a3ebfeb9071f679c58c5421e744cb2933ded9d2c741e18f","source":{"kind":"arxiv","id":"2311.11045","version":2},"attestation_state":"computed","paper":{"title":"Orca 2: Teaching Small Language Models How to Reason","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Ahmed Awadallah, Anastasia Razdaibiedina, Andres Codas, Arindam Mitra, Clarisse Simoes, Corby Rosset, Erik Jones, Guoqing Zheng, Hamed Khanpour, Hamid Palangi, Kriti Aggarwal, Luciano Del Corro, Sahaj Agarwal, Shweti Mahajan, Xuxi Chen","submitted_at":"2023-11-18T11:44:52Z","abstract_excerpt":"Orca 1 learns from rich signals, such as explanation traces, allowing it to outperform conventional instruction-tuned models on benchmarks like BigBench Hard and AGIEval. In Orca 2, we continue exploring how improved training signals can enhance smaller LMs' reasoning abilities. Research on training small LMs has often relied on imitation learning to replicate the output of more capable models. We contend that excessive emphasis on imitation may restrict the potential of smaller models. We seek to teach small LMs to employ different solution strategies for different tasks, potentially differen"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.11045","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2023-11-18T11:44:52Z","cross_cats_sorted":[],"title_canon_sha256":"866f2a807c7b99c6b3325404eecdf5bb6fff33df4548e93bb2a6d5e3ec579f34","abstract_canon_sha256":"20517786ba0274ce3584a941a15c8e31599ea472a629c9b4a002589f91f28073"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:15:18.023475Z","signature_b64":"PqUC6Cs8+fNMRaf4HYjTxJ8HocbJqh0sQcOyCpZ8d91cCWcEW4nbpY6t2kLCn+PQ1IEwHeFH9jHc/KWgptXbAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4de938c2b378869a7a3ebfeb9071f679c58c5421e744cb2933ded9d2c741e18f","last_reissued_at":"2026-07-05T07:15:18.022991Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:15:18.022991Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Orca 2: Teaching Small Language Models How to Reason","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Ahmed Awadallah, Anastasia Razdaibiedina, Andres Codas, Arindam Mitra, Clarisse Simoes, Corby Rosset, Erik Jones, Guoqing Zheng, Hamed Khanpour, Hamid Palangi, Kriti Aggarwal, Luciano Del Corro, Sahaj Agarwal, Shweti Mahajan, Xuxi Chen","submitted_at":"2023-11-18T11:44:52Z","abstract_excerpt":"Orca 1 learns from rich signals, such as explanation traces, allowing it to outperform conventional instruction-tuned models on benchmarks like BigBench Hard and AGIEval. In Orca 2, we continue exploring how improved training signals can enhance smaller LMs' reasoning abilities. Research on training small LMs has often relied on imitation learning to replicate the output of more capable models. We contend that excessive emphasis on imitation may restrict the potential of smaller models. We seek to teach small LMs to employ different solution strategies for different tasks, potentially differen"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.11045","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.11045/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.11045","created_at":"2026-07-05T07:15:18.023042+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.11045v2","created_at":"2026-07-05T07:15:18.023042+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.11045","created_at":"2026-07-05T07:15:18.023042+00:00"},{"alias_kind":"pith_short_12","alias_value":"JXUTRQVTPCDJ","created_at":"2026-07-05T07:15:18.023042+00:00"},{"alias_kind":"pith_short_16","alias_value":"JXUTRQVTPCDJU6R6","created_at":"2026-07-05T07:15:18.023042+00:00"},{"alias_kind":"pith_short_8","alias_value":"JXUTRQVT","created_at":"2026-07-05T07:15:18.023042+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26749","citing_title":"Structure Before Collapse: Transient semantic geometry in next-token prediction","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07604","citing_title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","ref_index":113,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19002","citing_title":"Enhancing Multilingual Reasoning via Steerable Model Merging","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2501.05465","citing_title":"Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2503.08223","citing_title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","ref_index":161,"is_internal_anchor":false},{"citing_arxiv_id":"2509.22075","citing_title":"CoSpaDi: Compressing LLMs via Calibration-Guided Sparse Dictionary Learning","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2504.21318","citing_title":"Phi-4-reasoning Technical Report","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04215","citing_title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08472","citing_title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08898","citing_title":"LLM-Agnostic Semantic Representation Attack","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04215","citing_title":"Predict-then-Diffuse: Adaptive Response Length for Compute-Budgeted Inference in Diffusion LLMs","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07941","citing_title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16845","citing_title":"DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training","ref_index":6,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH","json":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH.json","graph_json":"https://pith.science/api/pith-number/JXUTRQVTPCDJU6R6X7VZA4PWPH/graph.json","events_json":"https://pith.science/api/pith-number/JXUTRQVTPCDJU6R6X7VZA4PWPH/events.json","paper":"https://pith.science/paper/JXUTRQVT"},"agent_actions":{"view_html":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH","download_json":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH.json","view_paper":"https://pith.science/paper/JXUTRQVT","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.11045&json=true","fetch_graph":"https://pith.science/api/pith-number/JXUTRQVTPCDJU6R6X7VZA4PWPH/graph.json","fetch_events":"https://pith.science/api/pith-number/JXUTRQVTPCDJU6R6X7VZA4PWPH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH/action/storage_attestation","attest_author":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH/action/author_attestation","sign_citation":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH/action/citation_signature","submit_replication":"https://pith.science/pith/JXUTRQVTPCDJU6R6X7VZA4PWPH/action/replication_record"}},"created_at":"2026-07-05T07:15:18.023042+00:00","updated_at":"2026-07-05T07:15:18.023042+00:00"}