{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2021:WEERGLULX4W3KXEK2DNLUOOILF","short_pith_number":"pith:WEERGLUL","schema_version":"1.0","canonical_sha256":"b109132e8bbf2db55c8ad0daba39c859435c70808e487bc51375ca19085d047e","source":{"kind":"arxiv","id":"2103.10360","version":2},"attestation_state":"computed","paper":{"title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Jie Tang, Jiezhong Qiu, Ming Ding, Xiao Liu, Yujie Qian, Zhengxiao Du, Zhilin Yang","submitted_at":"2021-03-18T16:30:26Z","abstract_excerpt":"There have been various types of pretraining architectures including autoencoding models (e.g., BERT), autoregressive models (e.g., GPT), and encoder-decoder models (e.g., T5). However, none of the pretraining frameworks performs the best for all tasks of three main categories including natural language understanding (NLU), unconditional generation, and conditional generation. We propose a General Language Model (GLM) based on autoregressive blank infilling to address this challenge. GLM improves blank filling pretraining by adding 2D positional encodings and allowing an arbitrary order to pre"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2103.10360","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2021-03-18T16:30:26Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"5ac1f6b9147ccdb8087d3ac2bf4099753cacf029af30546d6295ade1021c0664","abstract_canon_sha256":"1da04fbe799423ee30b20f131ea95468607612e02cf7642c96ecf4884c74d697"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:05:57.727608Z","signature_b64":"Wfv2aI5YdTXGa7mAWy1PV4MhibO7gqdw/cBFasuNiJQiQxAM0LUmQMOOS4dmdrMK5I6Gl9jqzXvXoiH5jVpFCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b109132e8bbf2db55c8ad0daba39c859435c70808e487bc51375ca19085d047e","last_reissued_at":"2026-07-05T04:05:57.727123Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:05:57.727123Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Jie Tang, Jiezhong Qiu, Ming Ding, Xiao Liu, Yujie Qian, Zhengxiao Du, Zhilin Yang","submitted_at":"2021-03-18T16:30:26Z","abstract_excerpt":"There have been various types of pretraining architectures including autoencoding models (e.g., BERT), autoregressive models (e.g., GPT), and encoder-decoder models (e.g., T5). However, none of the pretraining frameworks performs the best for all tasks of three main categories including natural language understanding (NLU), unconditional generation, and conditional generation. We propose a General Language Model (GLM) based on autoregressive blank infilling to address this challenge. GLM improves blank filling pretraining by adding 2D positional encodings and allowing an arbitrary order to pre"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2103.10360","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2103.10360/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2103.10360","created_at":"2026-07-05T04:05:57.727181+00:00"},{"alias_kind":"arxiv_version","alias_value":"2103.10360v2","created_at":"2026-07-05T04:05:57.727181+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2103.10360","created_at":"2026-07-05T04:05:57.727181+00:00"},{"alias_kind":"pith_short_12","alias_value":"WEERGLULX4W3","created_at":"2026-07-05T04:05:57.727181+00:00"},{"alias_kind":"pith_short_16","alias_value":"WEERGLULX4W3KXEK","created_at":"2026-07-05T04:05:57.727181+00:00"},{"alias_kind":"pith_short_8","alias_value":"WEERGLUL","created_at":"2026-07-05T04:05:57.727181+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2410.13903","citing_title":"CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05974","citing_title":"PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2406.08035","citing_title":"LVBench: An Extreme Long Video Understanding Benchmark","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2312.16886","citing_title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2401.15947","citing_title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2309.10253","citing_title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14055","citing_title":"PEML: Parameter-efficient Multi-Task Learning with Optimized Continuous Prompts","ref_index":95,"is_internal_anchor":false},{"citing_arxiv_id":"2404.14294","citing_title":"A Survey on Efficient Inference for Large Language Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2404.06395","citing_title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2311.12793","citing_title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2403.20330","citing_title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08840","citing_title":"ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05974","citing_title":"PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08299","citing_title":"SeLaR: Selective Latent Reasoning in Large Language Models","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14825","citing_title":"Nautilus: An Auto-Scheduling Tensor Compiler for Efficient Tiled GPU Kernels","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF","json":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF.json","graph_json":"https://pith.science/api/pith-number/WEERGLULX4W3KXEK2DNLUOOILF/graph.json","events_json":"https://pith.science/api/pith-number/WEERGLULX4W3KXEK2DNLUOOILF/events.json","paper":"https://pith.science/paper/WEERGLUL"},"agent_actions":{"view_html":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF","download_json":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF.json","view_paper":"https://pith.science/paper/WEERGLUL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2103.10360&json=true","fetch_graph":"https://pith.science/api/pith-number/WEERGLULX4W3KXEK2DNLUOOILF/graph.json","fetch_events":"https://pith.science/api/pith-number/WEERGLULX4W3KXEK2DNLUOOILF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF/action/storage_attestation","attest_author":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF/action/author_attestation","sign_citation":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF/action/citation_signature","submit_replication":"https://pith.science/pith/WEERGLULX4W3KXEK2DNLUOOILF/action/replication_record"}},"created_at":"2026-07-05T04:05:57.727181+00:00","updated_at":"2026-07-05T04:05:57.727181+00:00"}