{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:4YORXJVVL7HMQV7AZFKUCI6PRF","short_pith_number":"pith:4YORXJVV","schema_version":"1.0","canonical_sha256":"e61d1ba6b55fcec857e0c9554123cf894d4d0ceb4f5260b8a5dd829161390abf","source":{"kind":"arxiv","id":"2412.00535","version":6},"attestation_state":"computed","paper":{"title":"FullStack Bench: Evaluating LLMs as Full Stack Coders","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SE"],"primary_cat":"cs.AI","authors_text":"Aoyan Li, Bo Li, Bowen Li, Boyi Liu, Bytedance-Seed-Foundation-Code-Team: Yao Cheng, Chenguang Xi, Guanghan Ning, Guoyin Wang, He Zhu, Hongxia Yang, Jack Yang, Jiahao Su, Jiaheng Liu, Jianbo Yuan, Jianfeng Chen, Jie Chen, Jingjing Xu, Jing Mai, Jing Su, Jinxiang Xia, Jun Zhang, Kaibo Liu, Kai Shen, Liang Xiang, Li Chen, Linyi Li, Liyu Chen, Ming Zhu, Qi Liu, Rui Long, Shen Zheng, Shijie Geng, Shikun Xu, Shukai Liu, Shulin Xin, Siwei Wang, Siyao Liu, Tao Sun, Tianyi Liu, Tingkai Liu, Wentao Chen, Xia Xiao, Xuwu Wang, Yifan Sun, Yingxiang Yang, Yite Wang, Yongfei Liu, Yongsheng Xiao, Yufeng Zhang, Yunzhe Tao, Yuyu Zhang, Zhengyu Chen, Zihan Wang, Z.Y. Peng","submitted_at":"2024-11-30T16:58:42Z","abstract_excerpt":"As the capabilities of code large language models (LLMs) continue to expand, their applications across diverse code intelligence domains are rapidly increasing. However, most existing datasets only evaluate limited application domains. To address this gap, we have developed a comprehensive code evaluation dataset FullStack Bench focusing on full-stack programming, which encompasses a wide range of application domains (e.g., basic programming, data analysis, software engineering, mathematics, and machine learning). Besides, to assess multilingual programming capabilities, in FullStack Bench, we"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.00535","kind":"arxiv","version":6},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-11-30T16:58:42Z","cross_cats_sorted":["cs.SE"],"title_canon_sha256":"d68523fab2381f50788ff8896270a03f1c992e8c17f0cb40cf60a93295c36bf3","abstract_canon_sha256":"1b40167f7ecd7eb6eb0bcc8dc3e71beb15cced401ce336ddc01b5fc48fdfff02"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:01:29.409340Z","signature_b64":"7p4aYFqK6qXl5W0IdpTJKDlQA9GuKTko3o8PysCSa/5CqgLE9AuZ4SyG12s1m9ybqBuSgspe7bt2y+vtT45jCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e61d1ba6b55fcec857e0c9554123cf894d4d0ceb4f5260b8a5dd829161390abf","last_reissued_at":"2026-07-05T11:01:29.408757Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:01:29.408757Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FullStack Bench: Evaluating LLMs as Full Stack Coders","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.SE"],"primary_cat":"cs.AI","authors_text":"Aoyan Li, Bo Li, Bowen Li, Boyi Liu, Bytedance-Seed-Foundation-Code-Team: Yao Cheng, Chenguang Xi, Guanghan Ning, Guoyin Wang, He Zhu, Hongxia Yang, Jack Yang, Jiahao Su, Jiaheng Liu, Jianbo Yuan, Jianfeng Chen, Jie Chen, Jingjing Xu, Jing Mai, Jing Su, Jinxiang Xia, Jun Zhang, Kaibo Liu, Kai Shen, Liang Xiang, Li Chen, Linyi Li, Liyu Chen, Ming Zhu, Qi Liu, Rui Long, Shen Zheng, Shijie Geng, Shikun Xu, Shukai Liu, Shulin Xin, Siwei Wang, Siyao Liu, Tao Sun, Tianyi Liu, Tingkai Liu, Wentao Chen, Xia Xiao, Xuwu Wang, Yifan Sun, Yingxiang Yang, Yite Wang, Yongfei Liu, Yongsheng Xiao, Yufeng Zhang, Yunzhe Tao, Yuyu Zhang, Zhengyu Chen, Zihan Wang, Z.Y. Peng","submitted_at":"2024-11-30T16:58:42Z","abstract_excerpt":"As the capabilities of code large language models (LLMs) continue to expand, their applications across diverse code intelligence domains are rapidly increasing. However, most existing datasets only evaluate limited application domains. To address this gap, we have developed a comprehensive code evaluation dataset FullStack Bench focusing on full-stack programming, which encompasses a wide range of application domains (e.g., basic programming, data analysis, software engineering, mathematics, and machine learning). Besides, to assess multilingual programming capabilities, in FullStack Bench, we"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.00535","kind":"arxiv","version":6},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.00535/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.00535","created_at":"2026-07-05T11:01:29.408840+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.00535v6","created_at":"2026-07-05T11:01:29.408840+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.00535","created_at":"2026-07-05T11:01:29.408840+00:00"},{"alias_kind":"pith_short_12","alias_value":"4YORXJVVL7HM","created_at":"2026-07-05T11:01:29.408840+00:00"},{"alias_kind":"pith_short_16","alias_value":"4YORXJVVL7HMQV7A","created_at":"2026-07-05T11:01:29.408840+00:00"},{"alias_kind":"pith_short_8","alias_value":"4YORXJVV","created_at":"2026-07-05T11:01:29.408840+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.15079","citing_title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","ref_index":188,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26842","citing_title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22138","citing_title":"Efficient Agentic Reasoning Through Self-Regulated Simulative Planning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22642","citing_title":"Spreadsheet-RL: Advancing Large Language Model Agents on Realistic Spreadsheet Tasks via Reinforcement Learning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2601.04809","citing_title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2508.05748","citing_title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13641","citing_title":"Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13641","citing_title":"Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02794","citing_title":"CharTool: Tool-Integrated Visual Reasoning for Chart Understanding","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03144","citing_title":"InCoder-32B-Thinking: Industrial Code World Model for Thinking","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04017","citing_title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04637","citing_title":"SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF","json":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF.json","graph_json":"https://pith.science/api/pith-number/4YORXJVVL7HMQV7AZFKUCI6PRF/graph.json","events_json":"https://pith.science/api/pith-number/4YORXJVVL7HMQV7AZFKUCI6PRF/events.json","paper":"https://pith.science/paper/4YORXJVV"},"agent_actions":{"view_html":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF","download_json":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF.json","view_paper":"https://pith.science/paper/4YORXJVV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.00535&json=true","fetch_graph":"https://pith.science/api/pith-number/4YORXJVVL7HMQV7AZFKUCI6PRF/graph.json","fetch_events":"https://pith.science/api/pith-number/4YORXJVVL7HMQV7AZFKUCI6PRF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF/action/storage_attestation","attest_author":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF/action/author_attestation","sign_citation":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF/action/citation_signature","submit_replication":"https://pith.science/pith/4YORXJVVL7HMQV7AZFKUCI6PRF/action/replication_record"}},"created_at":"2026-07-05T11:01:29.408840+00:00","updated_at":"2026-07-05T11:01:29.408840+00:00"}