{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:ZPDO5CVLEWCM2VZSMC43AOJ6HD","short_pith_number":"pith:ZPDO5CVL","schema_version":"1.0","canonical_sha256":"cbc6ee8aab2584cd573260b9b0393e38edf231a240d53ebc7295833e4243b472","source":{"kind":"arxiv","id":"2410.09426","version":4},"attestation_state":"computed","paper":{"title":"FlatQuant: Flatness Matters for LLM Quantization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Chun Yuan, Han Bao, Haoli Bai, Jiaxin Hu, Jun Yao, Kang Zhao, Lu Hou, Ruikang Liu, Wulong Liu, Xianzhi Yu, Xin Jiang, Yuening Li, Yuxuan Sun","submitted_at":"2024-10-12T08:10:28Z","abstract_excerpt":"Recently, quantization has been widely used for the compression and acceleration of large language models (LLMs). Due to the outliers in LLMs, it is crucial to flatten weights and activations to minimize quantization error with equally spaced quantization points. Prior research explores various pre-quantization transformations to suppress outliers, such as per-channel scaling and Hadamard transformation. However, we observe that these transformed weights and activations can still exhibit steep and dispersed distributions. In this paper, we propose FlatQuant (Fast and Learnable Affine Transform"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.09426","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-10-12T08:10:28Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"6dc9a2223e1d2207c267d244a02fbe854b00f5c24934d758a83689a3cabb7777","abstract_canon_sha256":"e605038e1ae82450551cef80f37992851f7c21fbdbf912b8b86153789ed67b41"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:51:18.291226Z","signature_b64":"6En+zfEwnNbfYF16AHju5EF4wdMkH4Spg5j1bquvEgV5UH+K40fd3vDmPKpEytKh3Y3Cq2pQMHw9zjaQq0NACg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"cbc6ee8aab2584cd573260b9b0393e38edf231a240d53ebc7295833e4243b472","last_reissued_at":"2026-07-05T11:51:18.290658Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:51:18.290658Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FlatQuant: Flatness Matters for LLM Quantization","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Chun Yuan, Han Bao, Haoli Bai, Jiaxin Hu, Jun Yao, Kang Zhao, Lu Hou, Ruikang Liu, Wulong Liu, Xianzhi Yu, Xin Jiang, Yuening Li, Yuxuan Sun","submitted_at":"2024-10-12T08:10:28Z","abstract_excerpt":"Recently, quantization has been widely used for the compression and acceleration of large language models (LLMs). Due to the outliers in LLMs, it is crucial to flatten weights and activations to minimize quantization error with equally spaced quantization points. Prior research explores various pre-quantization transformations to suppress outliers, such as per-channel scaling and Hadamard transformation. However, we observe that these transformed weights and activations can still exhibit steep and dispersed distributions. In this paper, we propose FlatQuant (Fast and Learnable Affine Transform"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.09426","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.09426/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.09426","created_at":"2026-07-05T11:51:18.290727+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.09426v4","created_at":"2026-07-05T11:51:18.290727+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.09426","created_at":"2026-07-05T11:51:18.290727+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZPDO5CVLEWCM","created_at":"2026-07-05T11:51:18.290727+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZPDO5CVLEWCM2VZS","created_at":"2026-07-05T11:51:18.290727+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZPDO5CVL","created_at":"2026-07-05T11:51:18.290727+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07964","citing_title":"KronQ: LLM Quantization via Kronecker-Factored Hessian","ref_index":32,"is_internal_anchor":true},{"citing_arxiv_id":"2606.20437","citing_title":"HEPTv2: End-to-End Efficient Point Transformer for Charged Particle Reconstruction","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02461","citing_title":"OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12487","citing_title":"DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06547","citing_title":"FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04050","citing_title":"LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02823","citing_title":"Qift: Shift-Friendly No-Zero W2 Post-Training Quantization for Rotated W2A4/KV4 LLM Inference","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00206","citing_title":"Quantized Reasoning Models Think They Need to Think Longer, but They Do Not","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04050","citing_title":"LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26175","citing_title":"InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28803","citing_title":"HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31035","citing_title":"MixFP4: Enhancing NVFP4 with Adaptive FP4/INT4 Block Representations","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18800","citing_title":"Theory-optimal Quantization Based on Flatness","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18475","citing_title":"GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19218","citing_title":"Rotation-Aligned Key Channel Pruning for Efficient Vision-Language Model Inference","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19929","citing_title":"Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2506.12040","citing_title":"BTC-LLM: Efficient Sub-1-Bit LLM Quantization via Learnable Transformation and Binary Codebook","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20309","citing_title":"QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04013","citing_title":"RUQuant: Towards Refining Uniform Quantization for Large Language Models","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24088","citing_title":"TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22577","citing_title":"QuantClaw: Precision Where It Matters for OpenClaw","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12782","citing_title":"OSC: Hardware Efficient W4A4 Quantization via Outlier Separation in Channel Dimension","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09742","citing_title":"Efficient Matrix Implementation for Rotary Position Embedding","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18556","citing_title":"GSQ: Highly-Accurate Low-Precision Scalar Quantization for LLMs via Gumbel-Softmax Sampling","ref_index":27,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD","json":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD.json","graph_json":"https://pith.science/api/pith-number/ZPDO5CVLEWCM2VZSMC43AOJ6HD/graph.json","events_json":"https://pith.science/api/pith-number/ZPDO5CVLEWCM2VZSMC43AOJ6HD/events.json","paper":"https://pith.science/paper/ZPDO5CVL"},"agent_actions":{"view_html":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD","download_json":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD.json","view_paper":"https://pith.science/paper/ZPDO5CVL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.09426&json=true","fetch_graph":"https://pith.science/api/pith-number/ZPDO5CVLEWCM2VZSMC43AOJ6HD/graph.json","fetch_events":"https://pith.science/api/pith-number/ZPDO5CVLEWCM2VZSMC43AOJ6HD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD/action/storage_attestation","attest_author":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD/action/author_attestation","sign_citation":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD/action/citation_signature","submit_replication":"https://pith.science/pith/ZPDO5CVLEWCM2VZSMC43AOJ6HD/action/replication_record"}},"created_at":"2026-07-05T11:51:18.290727+00:00","updated_at":"2026-07-05T11:51:18.290727+00:00"}