{"as_of":"2026-08-09T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57d0781b7dbdd632cd75b02c493666ee7e1a2810498d43ecebce4b9f8d8b01b6","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:44:48.501356Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:03:44.648169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:47:26.479505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05003","snapshot_observed_at":"2026-08-07T23:03:44.648169Z","title":"L., Nikdan, M., and Alistarh, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09003","last_updated":"2025-06-06T02:29:18Z","snapshot_observed_at":"2026-08-09T10:27:15.269103Z","submitted_at":"2025-02-13T06:44:33Z","title":"RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:03:44.648169Z"},"links":{"cited_paper":"/paper/2502.05003","citing_paper":"/paper/2502.09003"},"observation_digest":"sha256:75a89a7ae28350104ae472d6f1d71828cd2042dcdbe5ec4a435877a7b3b77943","observation_id":"dd72ea8d-4238-480b-89eb-25cb911e6a7b","resolution":{"observed_at":"2026-08-07T23:03:44.648169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05003","snapshot_observed_at":"2026-08-07T15:41:08.146988Z","title":"Quest: Stable training of llms with 1-bit weights and activations.arXiv preprint arXiv:2502.05003, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14302","last_updated":"2025-05-20T12:54:43Z","snapshot_observed_at":"2026-08-07T15:43:23.244437Z","submitted_at":"2025-05-20T12:54:43Z","title":"Scaling Law for Quantization-Aware Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:08.146988Z"},"links":{"cited_paper":"/paper/2502.05003","citing_paper":"/paper/2505.14302"},"observation_digest":"sha256:752286fe26cf7d47222e3e3e4e7c4b945dc96af86054ffa52bedec9c1d4efaf3","observation_id":"0d03675b-b4af-43a8-9b9a-58862f3451e3","resolution":{"observed_at":"2026-08-07T15:41:08.146988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05003","snapshot_observed_at":"2026-08-07T14:25:38.408806Z","title":"Castro, Mahdi Nikdan, and Dan Alis- tarh","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19115","last_updated":"2025-08-10T07:10:29Z","snapshot_observed_at":"2026-08-09T06:55:04.491282Z","submitted_at":"2025-05-25T12:14:25Z","title":"FP4 All the Way: Fully Quantized Training of LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:38.408806Z"},"links":{"cited_paper":"/paper/2502.05003","citing_paper":"/paper/2505.19115"},"observation_digest":"sha256:8d7abb6f2d491a48fa894eeabee7fa024890f3873d71e1d2f44e1e9febe28e51","observation_id":"8d5d4d8a-3600-43c7-8af9-e07044b03515","resolution":{"observed_at":"2026-08-07T14:25:38.408806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05003","snapshot_observed_at":"2026-08-07T11:40:09.909242Z","title":"L., Nikdan, M., and Alistarh, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01863","last_updated":"2025-06-02T16:52:51Z","snapshot_observed_at":"2026-08-07T23:41:22.236547Z","submitted_at":"2025-06-02T16:52:51Z","title":"Unified Scaling Laws for Compressed Representations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.909242Z"},"links":{"cited_paper":"/paper/2502.05003","citing_paper":"/paper/2506.01863"},"observation_digest":"sha256:68341d0cdd48f9b54e91675152a97afb6caff6b27685ab2098a864227b2b6a7f","observation_id":"4c0ccf2a-2b84-4fdc-995f-53ff96de54c8","resolution":{"observed_at":"2026-08-07T11:40:09.909242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"cited_work":{"arxiv_id":"2502.05003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Castro, Mahdi Nikdan, and Dan Alistarh","venue":null,"work_id":"8d99e2df-7693-4c8c-bdcc-c895c31cf5f6","year":2025},"citing_paper":{"arxiv_id":"2605.12327","last_updated":"2026-05-12T16:09:02Z","snapshot_observed_at":"2026-08-03T03:41:10.713228Z","submitted_at":"2026-05-12T16:09:02Z","title":"Grid Games: The Power of Multiple Grids for Quantizing Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T06:44:59.501345Z"},"links":{"cited_paper":"/paper/2502.05003","citing_paper":"/paper/2605.12327"},"observation_digest":"sha256:c7e2377935a70545d58dccede405edee229177a77bf25a14d52a0615326d86dd","observation_id":"cd28a4c3-804b-470b-960f-b73fc20931a0","resolution":{"observed_at":"2026-05-13T06:47:26.483109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05003/citation-record","integrity":"/paper/2502.05003/integrity","json":"/paper/2502.05003/citation-record.json","paper":"/paper/2502.05003"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1805.06085","last_updated":"2018-07-17T07:33:19Z","snapshot_observed_at":"2026-07-06T06:39:21.688392Z","submitted_at":"2018-05-16T01:19:43Z","title":"PACT: Parameterized Clipping Activation for Quantized Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.06085","snapshot_observed_at":"2026-08-08T20:44:48.413268Z","title":"I.-J., Srini- vasan, V ., and Gopalakrishnan, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.413268Z"},"links":{"cited_paper":"/paper/1805.06085","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:365b15f4e7b583b16716860a99f01ad0875179eda4efd7c0e7172d77e88cd925","observation_id":"0dea6fb7-6f1c-4d97-baa4-d79ff3f46d4b","resolution":{"observed_at":"2026-08-08T20:44:48.413268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.910327Z","title":"2:4 INT4","venue":null,"work_id":"7b40e957-37ba-41c2-8209-1c0b080ef107","year":2000},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.492218Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:0d03adb1820748951f6acb3aa39fe025b26e543b613691b047458c0bd3257c5a","observation_id":"80d6743b-4aef-40bf-a357-bf0981496b21","resolution":{"observed_at":"2026-08-08T20:44:48.913395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-08T23:08:43.190961Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-08T20:44:48.419937Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.419937Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:cae6f22b612966b87f3060094cc108748f3f3b7938e792635e639af3039938e8","observation_id":"c548efff-8269-4b41-bc52-41e19c002947","resolution":{"observed_at":"2026-08-08T20:44:48.419937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.03118","last_updated":"2017-11-02T02:48:38Z","snapshot_observed_at":"2026-08-02T23:09:11.731136Z","submitted_at":"2017-02-10T10:04:30Z","title":"Sigmoid-Weighted Linear Units for Neural Network Function Approximation in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.03118","snapshot_observed_at":"2026-08-08T20:44:48.426116Z","title":"org/abs/1702.03118","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.426116Z"},"links":{"cited_paper":"/paper/1702.03118","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:4046494a9ffb59bbbc044949153f71729aceb65c1650bda08df52cbc4d2d8608","observation_id":"9523e6ea-2daf-4f1b-9db7-f829fd379ab6","resolution":{"observed_at":"2026-08-08T20:44:48.426116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-08T20:44:48.429321Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers.arXiv preprint arXiv:2210.17323,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.429321Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:5f9291046bda029843f4d1b14605a7bf6914ec53c0ec6052eee6564071d35b27","observation_id":"f92e385d-eb77-49e4-b2a4-190ea8f8a5c2","resolution":{"observed_at":"2026-08-08T20:44:48.429321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08520","last_updated":"2023-09-15T16:29:27Z","snapshot_observed_at":"2026-08-04T08:11:54.845425Z","submitted_at":"2023-09-15T16:29:27Z","title":"Scaling Laws for Sparsely-Connected Foundation Models","version":1},"cited_work":{"arxiv_id":"2309.08520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.08520","snapshot_observed_at":"2026-08-08T20:44:48.795871Z","title":"Scaling Laws for Sparsely-Connected Foundation Models","venue":"cs.LG","work_id":"e004bbcb-c839-4c4d-a0d1-ff287682d8a1","year":2023},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.432495Z"},"links":{"cited_paper":"/paper/2309.08520","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:306dcd01c913d1fa99a374a9b57685abc684d6d97a56543148db553c63d0a2f9","observation_id":"a16b1939-9604-4793-952f-8c496c0761c2","resolution":{"observed_at":"2026-08-08T20:44:48.799372Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-08T20:44:48.435471Z","title":"Hubara, I., Courbariaux, M., Soudry, D., El-Yaniv, R., and Bengio, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.435471Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:4a0ed8116316ccecf56122ef47b348f6b06c0524ac58b89b7c5228ba62311176","observation_id":"d695d4b7-448e-4b5b-b158-19580f9edf91","resolution":{"observed_at":"2026-08-08T20:44:48.435471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04330","last_updated":"2024-11-30T02:42:31Z","snapshot_observed_at":"2026-08-04T07:47:22.112536Z","submitted_at":"2024-11-07T00:10:10Z","title":"Scaling Laws for Precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04330","snapshot_observed_at":"2026-08-08T20:44:48.443920Z","title":"F., Bordelon, B., Muen- nighoff, N., Paul, M., Pehlevan, C., R´e, C., and Raghu- nathan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.443920Z"},"links":{"cited_paper":"/paper/2411.04330","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:0671b3f4b48097956d257676da22a5eb1c3955bcf92255b13f830065f353fda4","observation_id":"08afdb74-a924-4455-b045-0f40949cdcbd","resolution":{"observed_at":"2026-08-08T20:44:48.443920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-08T20:44:48.446391Z","title":"Spinquant–llm quantization with learned rotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.446391Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:5b6b4c9ac82066767d244d689291d922bbc01ca98f870d54ad5aba3c555a314e","observation_id":"350f25d5-d1cb-4817-b654-3828407661dd","resolution":{"observed_at":"2026-08-08T20:44:48.446391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T20:44:48.449157Z","title":"Ma, S., Wang, H., Ma, L., Wang, L., Wang, W., Huang, S., Dong, L., Wang, R., Xue, J., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.449157Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:4b595fb54417428229e36d5bba5513c8ae50bca62de0a2e21c0b253b54b768b0","observation_id":"f2d0654e-83b0-4032-b08c-cef9abf3d41d","resolution":{"observed_at":"2026-08-08T20:44:48.449157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17764","last_updated":"2024-02-27T18:56:19Z","snapshot_observed_at":"2026-08-03T00:59:01.026576Z","submitted_at":"2024-02-27T18:56:19Z","title":"The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17764","snapshot_observed_at":"2026-08-08T20:44:48.451632Z","title":"Malinovskii, V ., Panferov, A., Ilin, I., Guo, H., Richt´arik, P., and Alistarh, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.451632Z"},"links":{"cited_paper":"/paper/2402.17764","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:2e2247580ceb56dc87642613a71fa8bac174336bf13e9c1c6e9317e41bd4a739","observation_id":"a59fb065-89e2-437c-af6e-5e24e6dc7a94","resolution":{"observed_at":"2026-08-08T20:44:48.451632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03605","last_updated":"2024-08-26T20:48:19Z","snapshot_observed_at":"2026-08-04T21:48:31.671465Z","submitted_at":"2024-04-04T17:25:30Z","title":"Mitigating the Impact of Outlier Channels for Language Model Quantization with Activation Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03605","snapshot_observed_at":"2026-08-08T20:44:48.453946Z","title":"https://resources.nvidia.com/ en-us-blackwell-architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.453946Z"},"links":{"cited_paper":"/paper/2404.03605","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:8dd925fcddf9c6130836e2854b970eba67e66689be8b95e9bb087f71e0b16fc6","observation_id":"66eb65f4-4be3-4c6e-bfd7-b0d519b51c49","resolution":{"observed_at":"2026-08-08T20:44:48.453946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-08T20:44:48.456296Z","title":"Snell, C., Lee, J., Xu, K., and Kumar, A","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.456296Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:9b9a39ffdc5bb5b5d2125fd695adfa227dd734a1f4c485370b7392e5aa85904a","observation_id":"4a70ecdb-8adb-4db4-81be-139541be4bc7","resolution":{"observed_at":"2026-08-08T20:44:48.456296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-08T20:44:48.459696Z","title":"Suresh, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.459696Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:7b3a21737e4d57d4b69e9be0180c53b5f84b360976b4519b29b8a9aa2f79ce6f","observation_id":"c3954dc0-306c-49df-88c0-7239b2baa6a1","resolution":{"observed_at":"2026-08-08T20:44:48.459696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-08T20:44:48.462636Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.462636Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:a189f9446ac087c58d93cb142c3fecc5dde54513b706b306a5b5448efd7852b3","observation_id":"dff64a9f-c8c9-43af-8a41-aa2162ef1ab7","resolution":{"observed_at":"2026-08-08T20:44:48.462636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T20:44:48.465717Z","title":"Tri Dao, Nikos Karampatziakis, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.465717Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:5f03e612fcfb03f4988dc4e923a2f0b5033b8dfcd91d3fd0421224199f967082","observation_id":"5bcd912d-3982-4277-8c66-9eb0926352a6","resolution":{"observed_at":"2026-08-08T20:44:48.465717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08084","last_updated":"2022-10-03T14:23:42Z","snapshot_observed_at":"2026-07-06T13:42:36.328169Z","submitted_at":"2022-08-17T05:43:33Z","title":"AdaBin: Improving Binary Neural Networks with Adaptive Binary Sets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08084","snapshot_observed_at":"2026-08-08T20:44:48.468564Z","title":"Vargaftik, S., Basat, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.468564Z"},"links":{"cited_paper":"/paper/2208.08084","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:95b8e3a1c8fcda4d493fbbd06a29466a633d0f8cd5b8ada43df7abc5e8cdd8b3","observation_id":"839dc7de-d203-4981-99cc-ca6522294d58","resolution":{"observed_at":"2026-08-08T20:44:48.468564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08339","last_updated":"2021-12-16T10:39:04Z","snapshot_observed_at":"2026-07-06T11:10:23.958247Z","submitted_at":"2021-05-18T08:03:39Z","title":"DRIVE: One-bit Distributed Mean Estimation","version":5},"cited_work":{"arxiv_id":"2105.08339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.08339","snapshot_observed_at":"2026-08-08T20:44:48.577111Z","title":"DRIVE: One-bit Distributed Mean Estimation","venue":"cs.LG","work_id":"f6e5d9eb-ac43-46ce-8381-79500a283b83","year":2021},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.471588Z"},"links":{"cited_paper":"/paper/2105.08339","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:6ca4412c1c82a4e9dcee2f136ea28f34032a263422b30809fdeb4be4a8b4b469","observation_id":"93990542-faa2-4554-a353-12d707a862ce","resolution":{"observed_at":"2026-08-08T20:44:48.579892Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08842","last_updated":"2022-06-15T14:51:42Z","snapshot_observed_at":"2026-08-08T12:09:16.506750Z","submitted_at":"2021-08-19T17:59:21Z","title":"EDEN: Communication-Efficient and Robust Distributed Mean Estimation for Federated Learning","version":3},"cited_work":{"arxiv_id":"2108.08842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.08842","snapshot_observed_at":"2026-08-08T20:44:48.562864Z","title":"EDEN: Communication-Efficient and Robust Distributed Mean Estimation for Federated Learning","venue":"cs.LG","work_id":"a15bc64a-7620-47df-b886-c59b65d4a74b","year":2021},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.474431Z"},"links":{"cited_paper":"/paper/2108.08842","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:0adfd22f6f91a6b10d87d7bb7cf8c5cf9e841ea952415bb520289bf9a0991bce","observation_id":"a253c42e-ccc5-4d68-b101-ab3c32a42e5d","resolution":{"observed_at":"2026-08-08T20:44:48.568245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T20:44:48.477451Z","title":"Wang, H., Ma, S., Dong, L., Huang, S., Wang, H., Ma, L., Yang, F., Wang, R., Wu, Y ., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.477451Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:6c1238506692bd9365e7df90fe8066e66c75abce19b429bd08817c0f8e5693e4","observation_id":"64c202d1-28eb-4ec2-aa4f-93d83272c83c","resolution":{"observed_at":"2026-08-08T20:44:48.477451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04965","last_updated":"2024-11-07T18:41:50Z","snapshot_observed_at":"2026-08-04T09:57:22.968756Z","submitted_at":"2024-11-07T18:41:50Z","title":"BitNet a4.8: 4-bit Activations for 1-bit LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04965","snapshot_observed_at":"2026-08-08T20:44:48.480442Z","title":"Bitnet a4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.480442Z"},"links":{"cited_paper":"/paper/2411.04965","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:7ab5567df9d858545eec64f2368c5cf1b78cea74fc252c910c00e578ff960b31","observation_id":"81049eb2-1117-4bf9-957d-6cc2d03ddbf2","resolution":{"observed_at":"2026-08-08T20:44:48.480442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12422","last_updated":"2024-07-21T02:23:00Z","snapshot_observed_at":"2026-08-04T02:03:09.748626Z","submitted_at":"2024-03-19T04:09:11Z","title":"Jetfire: Efficient and Accurate Transformer Pretraining with INT8 Data Flow and Per-Block Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12422","snapshot_observed_at":"2026-08-08T20:44:48.483210Z","title":"Jetfire: Efficient and accurate transformer pretraining with int8 data flow and per-block quantization.arXiv preprint arXiv:2403.12422,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.483210Z"},"links":{"cited_paper":"/paper/2403.12422","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:5ae19da26f044501b44f9dec59f69010f3336308ddf0d4ef41e8b946f04ca86f","observation_id":"ebb6410c-ed18-40f4-99f7-9ef90f3ac0d7","resolution":{"observed_at":"2026-08-08T20:44:48.483210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19102","last_updated":"2024-04-16T06:08:05Z","snapshot_observed_at":"2026-08-05T04:04:11.667434Z","submitted_at":"2023-10-29T18:33:05Z","title":"Atom: Low-bit Quantization for Efficient and Accurate LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19102","snapshot_observed_at":"2026-08-08T20:44:48.486215Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving.arXiv preprint arXiv:2310.19102,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.486215Z"},"links":{"cited_paper":"/paper/2310.19102","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:80853936c46dd8d4b8c9f531515421be9b01ac247e8225dc8a2e8907b630d09d","observation_id":"7e3f4934-d3b9-49bb-a126-fac795bbde37","resolution":{"observed_at":"2026-08-08T20:44:48.486215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.918479Z","title":"Additional “Trust” Details A.1","venue":null,"work_id":"ccaf9d7c-70bf-4cb0-9bc6-78282d98b3fc","year":2000},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.489269Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:53a497f549f798a495714ccfae40865fb4a6a59f34bfe3d7a4296fc7f3ab7239","observation_id":"8915f77f-e821-4bec-9446-077388c602d4","resolution":{"observed_at":"2026-08-08T20:44:48.921811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.902061Z","title":"For the MLP block, it uses additional gate projection and SiLU (Elfwing et al.,","venue":null,"work_id":"0717985e-3db1-400b-9c7a-f5cab3d0091d","year":2023},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.495560Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:112e2e6d352eb5dc700c809a581741969cb2da6c634d60e2eea3284f41553c37","observation_id":"dc96839b-ce38-46b7-97ae-88726710461f","resolution":{"observed_at":"2026-08-08T20:44:48.905023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.893575Z","title":"We kept the MLP intermediate dimension equal to8/3of the hidden size, padding it to 256 for increased kernel compatibility","venue":null,"work_id":"c7bb2191-d53f-4e93-9ea2-80bfb1bf13ea","year":2000},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.498553Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:1c7f26dfc0f218648f6d5a11fd4040dd470069d02ccb1518b94f1422c930782e","observation_id":"a7d6a791-b9ac-41da-98dc-da57bcba8500","resolution":{"observed_at":"2026-08-08T20:44:48.896776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.884646Z","title":"As described in Section 4.3, we closely follow the fitting procedure of Hoffmann et al","venue":null,"work_id":"d21bd1f6-cd5e-49d0-b8d1-002e0f5dce74","year":2022},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.501356Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:4f32c6f2221c7fe0a9d8048d455fa09e93a1442e1315d85a44fed55a1ae5af80","observation_id":"7b85d5c2-de78-4037-8979-b6ac8a8dfb81","resolution":{"observed_at":"2026-08-08T20:44:48.887884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.438519Z","title":"URL https: //doi.org/10.1214/aoms/1177703732","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":1964,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.438519Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:0353cc127c634c243c6b365411b433e3952a82fc53ccc31146330ae89a46565b","observation_id":"ba3dadc1-6bc3-4d9c-b522-161ffcf6fcf3","resolution":{"observed_at":"2026-08-08T20:44:48.438519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:44:48.397508Z","title":"Alistarh, D., Grubic, D., Li, J., Tomioka, R., and V ojnovic, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.397508Z"},"links":{"citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:cbbf664afdcc333092ffffb90bd16ffd73a65aac95667019c8e1940c4d4ef604","observation_id":"a37a2b2e-be67-49ef-a3c2-5c34ce427a48","resolution":{"observed_at":"2026-08-08T20:44:48.397508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09259","last_updated":"2023-11-02T14:26:57Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T17:15:05Z","title":"QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09259","snapshot_observed_at":"2026-08-08T20:44:48.401788Z","title":"Towards end-to- end 4-bit inference on generative large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.401788Z"},"links":{"cited_paper":"/paper/2310.09259","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:ea4b5c7630cc2eb95b0050059232bd879595d9567cd340af42758177be664bc2","observation_id":"68e5e098-dcdd-4809-ac59-e273aa97d9c6","resolution":{"observed_at":"2026-08-08T20:44:48.401788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T20:44:48.416614Z","title":"Dettmers, T., Lewis, M., Belkada, Y ., and Zettlemoyer, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.416614Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:4e6bd892ec484c404ad965ca8dff295efccd9de589b9799e6cb2a6ce4f0fe07d","observation_id":"6bf7a098-5429-4188-9c42-389597c7e57b","resolution":{"observed_at":"2026-08-08T20:44:48.416614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-08T20:44:48.410343Z","title":"Chee, J., Cai, Y ., Kuleshov, V ., and De Sa, C","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.410343Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:eb75a46d82a09938a89ca9edd1bf1c51b145481a10cf87d7d3f87cb6aebf2850","observation_id":"9dcb243f-0123-40e6-9a26-a3a7641b6c2f","resolution":{"observed_at":"2026-08-08T20:44:48.410343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-03T11:31:09.198404Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-08T20:44:48.422880Z","title":"Dubey, A., Jauhri, A., Pandey, A., Kadian, A., Al-Dahle, A., Letman, A., Mathur, A., Schelten, A., Yang, A., Fan, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.422880Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:25e331782d22489fc47e06913451f1c870811fbf2d5881d1d08cbd7f1e0c0eca","observation_id":"fd732453-1172-4f8c-bc65-9408b451133c","resolution":{"observed_at":"2026-08-08T20:44:48.422880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11174","last_updated":"2022-08-23T20:02:42Z","snapshot_observed_at":"2026-07-06T13:44:48.609196Z","submitted_at":"2022-08-23T20:02:42Z","title":"Demystifying the Nvidia Ampere Architecture through Microbenchmarking and Instruction-level Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11174","snapshot_observed_at":"2026-08-08T20:44:48.392762Z","title":"Ailon, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.392762Z"},"links":{"cited_paper":"/paper/2208.11174","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:403f1920017b105c5670308b1243c2eaf1f5606e35d39169d808869a845e58c3","observation_id":"48ce5bd3-1114-4109-9ed5-56510e59bed9","resolution":{"observed_at":"2026-08-08T20:44:48.392762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-05T10:45:45.389337Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-08T20:44:48.404965Z","title":"L., Li, B., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.404965Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:78906b371442cf761b12d526bad533fcd07454f4ca7c8e47c1ac280200a731b0","observation_id":"9f495784-4a3c-4e22-a818-c54a27849091","resolution":{"observed_at":"2026-08-08T20:44:48.404965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-08T20:44:48.407664Z","title":"Estimating or propagating gradients through stochastic neurons for con- ditional computation.arXiv preprint arXiv:1308.3432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.407664Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:0036a1ba8bb66413dc33de50772fd4a54d17b23602002b2182a8254bdc2c6a2c","observation_id":"1434bf59-b639-4116-8fde-667080428ca7","resolution":{"observed_at":"2026-08-08T20:44:48.407664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12486","last_updated":"2025-03-15T17:31:09Z","snapshot_observed_at":"2026-08-06T05:58:01.203080Z","submitted_at":"2025-01-21T20:23:22Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","version":2},"cited_work":{"arxiv_id":"2501.12486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12486","snapshot_observed_at":"2026-08-08T20:44:48.658319Z","title":"The Journey Matters: Average Parameter Count over Pre-training Unifies Sparse and Dense Scaling Laws","venue":"cs.LG","work_id":"539097b9-d97e-40a2-9eb4-002bee21b4ff","year":2025},"citing_paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T20:44:48.441119Z"},"links":{"cited_paper":"/paper/2501.12486","citing_paper":"/paper/2502.05003"},"observation_digest":"sha256:ad18f0e8107f699cb99c46a896ce706e903171f55c513c3969c1203cb0181d9a","observation_id":"be29f8b8-dde7-43ba-8519-5dbca8c31da0","resolution":{"observed_at":"2026-08-08T20:44:48.662191Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05003","last_updated":"2025-06-10T18:01:40Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T10:27:19.269217Z","submitted_at":"2025-02-07T15:23:34Z","title":"QuEST: Stable Training of LLMs with 1-Bit Weights and Activations"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 5 inbound Pith citation observations for arXiv:2502.05003."}