{"as_of":"2026-08-09T21:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:db7d31dc2313e74d6258f28e907736917847e466966e83f3ab97648a811fcfcc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":54,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:28:42.183775Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:18:37.340082Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T13:49:33.747672Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2312.05821"},"observation_digest":"sha256:71c514be925b5b1fda1614804318957bed7ae69ecf1ebd7825ec1f4ae28795e7","observation_id":"fe5067cf-dab7-4166-aa91-a11026099e93","resolution":{"observed_at":"2026-05-20T13:49:33.850130Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-13T10:36:17.764761Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2401.10774"},"observation_digest":"sha256:0f1c37d87d415edc72641402b0947bf32ab4647ebc50f6516e4b5b05acaced0b","observation_id":"652a7ae9-34ed-4e07-bc1c-d8e964f9b301","resolution":{"observed_at":"2026-05-13T10:36:18.341205Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T08:53:12.253243Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2402.02750"},"observation_digest":"sha256:29f1c6e7d54882e004e0b1cb2dea8004576c49ec85de6321a0597467b625a76e","observation_id":"37c8d920-1703-41cf-9a2c-069a3b3898ab","resolution":{"observed_at":"2026-05-12T08:53:12.337562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2403.12031","last_updated":"2024-03-28T17:56:28Z","snapshot_observed_at":"2026-07-06T17:46:29.153377Z","submitted_at":"2024-03-18T17:59:04Z","title":"RouterBench: A Benchmark for Multi-LLM Routing System","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-16T10:47:31.006944Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2403.12031"},"observation_digest":"sha256:66ec19c932bef4cf593216337b15749dff9da2b6b2c5e67379c51bf26d435c37","observation_id":"8c46ab81-0c82-4bf6-82d4-4f4f738c1f12","resolution":{"observed_at":"2026-05-16T10:47:31.094875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:7674e60d856c7f2c017272523e18576abf14f30a5a780e288ff39971c8e7bad8","observation_id":"dc0a389b-ad0f-4564-b0d7-fec01552fe30","resolution":{"observed_at":"2026-05-15T02:39:33.214075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T15:52:34.606853Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2405.16406"},"observation_digest":"sha256:cdf053a981dd15dc039688a482845e3a668ed80d2ce696e9c0661e16d4afbc18","observation_id":"c2b6fba9-5454-4565-b948-54fe9cad1fec","resolution":{"observed_at":"2026-05-15T15:52:34.700791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-09T11:28:42.183775Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02723","last_updated":"2025-02-04T21:17:51Z","snapshot_observed_at":"2026-08-09T11:19:32.107810Z","submitted_at":"2025-02-04T21:17:51Z","title":"Dobi-SVD: Differentiable SVD for LLM Compression and Some New Perspectives","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T11:28:42.183775Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.02723"},"observation_digest":"sha256:f8c79ad1ecff8e91940f49af34449aa8104f61df9b1d872f10aad58dbf3adb38","observation_id":"8b308851-e505-4df8-ad27-7ad194f53a52","resolution":{"observed_at":"2026-08-09T11:28:42.183775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-08T18:42:15.010420Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05609","last_updated":"2025-02-08T15:32:53Z","snapshot_observed_at":"2026-08-09T00:36:24.320270Z","submitted_at":"2025-02-08T15:32:53Z","title":"Lossless Acceleration of Large Language Models with Hierarchical Drafting based on Temporal Locality in Speculative Decoding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T18:42:15.010420Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.05609"},"observation_digest":"sha256:87d9ce452767dfc2a23dcddbabeef63db6011bec50891213a171bcabc6f19153","observation_id":"82638e70-4319-4cad-85ea-af7a65b3dd55","resolution":{"observed_at":"2026-08-08T18:42:15.010420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-08T13:44:00.544467Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-09T09:01:49.466932Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.544467Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:e3a4b66ada89b80c81677b46c565bf15b45fad882d5a26b1a5fda300070ac737","observation_id":"82fa24fe-d6f5-4e80-a3b1-bf4e25e3196a","resolution":{"observed_at":"2026-08-08T13:44:00.544467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T21:38:34.760608Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09419","last_updated":"2025-02-13T15:42:44Z","snapshot_observed_at":"2026-08-07T21:46:16.569812Z","submitted_at":"2025-02-13T15:42:44Z","title":"On multi-token prediction for efficient LLM inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T21:38:34.760608Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.09419"},"observation_digest":"sha256:51965f0a8101cde4dc081b87f00f4a04495e649f94b405b26073c0a9333d98af","observation_id":"4eee505b-e77f-4694-be24-ab55ae4e2279","resolution":{"observed_at":"2026-08-07T21:38:34.760608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-09T04:28:03.938479Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-09T15:11:12.836727Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.938479Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:6b399a12ff65f5182622fa96c03e58b4ab1f3b3a09429aa68a68404bd52ac889","observation_id":"9949b154-5c0b-4936-8e4c-06b655bb5173","resolution":{"observed_at":"2026-08-09T04:28:03.938479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-07-06T20:50:33.513259Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:3a3dfda2a79ef75203296b0c0bb4bd39d41e9c09a48ded52c8e7a148b6b74bc0","observation_id":"a609dd30-4a14-47d9-b2e7-a04c77294da5","resolution":{"observed_at":"2026-05-23T01:05:16.310998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-01T14:10:27.172555Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T08:09:22.226608Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2504.19874"},"observation_digest":"sha256:93e2c718c634044a46fb11fe3ba51e05f112ff0a47469ee95573df2e2443d43e","observation_id":"e28853ba-9226-4caf-bf9b-35df3a4991a8","resolution":{"observed_at":"2026-05-20T08:09:22.277661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2505.02380","last_updated":"2026-01-26T11:44:39Z","snapshot_observed_at":"2026-07-06T21:18:55.327700Z","submitted_at":"2025-05-05T05:42:14Z","title":"EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T16:34:37.083239Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.02380"},"observation_digest":"sha256:13fadd5272b7468f6144d6be2091c34eb70f034febd8a74bc8fe9061d6b39b05","observation_id":"929dcb5e-aab5-4020-aca7-84de10b3c0bc","resolution":{"observed_at":"2026-05-22T16:34:59.261977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T15:36:05.656359Z","title":"Squeezellm: Dense- 9 and-sparse quantization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14638","last_updated":"2025-05-20T17:26:12Z","snapshot_observed_at":"2026-08-07T23:40:41.352977Z","submitted_at":"2025-05-20T17:26:12Z","title":"Dual Precision Quantization for Efficient and Accurate Deep Neural Networks Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:05.656359Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.14638"},"observation_digest":"sha256:4ec7657a63b22247dc9a464b8338cf43ed335bc9789bd59188df517a8284f1c9","observation_id":"776bbb39-0683-4ba8-a428-617b2fe31cc3","resolution":{"observed_at":"2026-08-07T15:36:05.656359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T15:09:28.498086Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16210","last_updated":"2025-05-22T04:23:19Z","snapshot_observed_at":"2026-08-08T09:52:35.968307Z","submitted_at":"2025-05-22T04:23:19Z","title":"NQKV: A KV Cache Quantization Scheme Based on Normal Distribution Characteristics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:28.498086Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.16210"},"observation_digest":"sha256:effc97f83d2cc7858c79254bc5d8c1090ab575c39fc475a288da871f55fb45bd","observation_id":"61b27dfa-542c-4af4-b9dc-1325f222f8d7","resolution":{"observed_at":"2026-08-07T15:09:28.498086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T14:42:21.069575Z","title":"Squeezellm: Dense-and-sparse quantization.arXiv preprint arXiv:2306.07629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T17:24:18.815874Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.069575Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:87ee6d67956052006b41efc8012e5ea3387f481f0d051475b91b77d9accf46ed","observation_id":"c33b91b4-7076-4fed-839a-2d4ea3d92494","resolution":{"observed_at":"2026-08-07T14:42:21.069575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T14:17:56.372336Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19433","last_updated":"2025-06-01T13:59:15Z","snapshot_observed_at":"2026-08-07T14:11:55.401752Z","submitted_at":"2025-05-26T02:49:07Z","title":"Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.372336Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.19433"},"observation_digest":"sha256:fcdeb48fd043531f476502e9992588bedf1d6e3d069121aa3718ed625f135b26","observation_id":"522070b8-6cf0-4e0d-a01a-26bae17ff451","resolution":{"observed_at":"2026-08-07T14:17:56.372336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T14:17:56.464514Z","title":"Koa, JL, K., Ma, Y ., Ng, R., and Chua, T.-S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19433","last_updated":"2025-06-01T13:59:15Z","snapshot_observed_at":"2026-08-07T14:11:55.401752Z","submitted_at":"2025-05-26T02:49:07Z","title":"Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.464514Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.19433"},"observation_digest":"sha256:774937403e432703519e3f2d1d4c5a937851112a3efcefd01eff6f5736d6de1f","observation_id":"d2d1cc3b-7958-4a42-afa3-9fa22aa93fd5","resolution":{"observed_at":"2026-08-07T14:17:56.464514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T10:43:46.395454Z","title":"Squeezellm: Dense-and-sparse quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04985","last_updated":"2026-07-08T07:56:27Z","snapshot_observed_at":"2026-08-08T14:49:23.884160Z","submitted_at":"2025-06-05T12:56:12Z","title":"FPTQuant: Function-Preserving Transforms for LLM Quantization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:46.395454Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2506.04985"},"observation_digest":"sha256:e2ae484a1fd1d248324954a7a6b362e079159a2743c0c62be3df68c0e13708a5","observation_id":"8667e534-2518-4bf2-954d-47bdcf62d9c7","resolution":{"observed_at":"2026-08-07T10:43:46.395454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T10:18:52.624716Z","title":"Squeezellm: Dense-and-sparse quantization.arXiv preprint arXiv:2306.07629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-08T05:15:14.895067Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.624716Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:a7935635aa85071f7a5dc9c1559a38453d75a183bfc21fab7f54549c62104cd1","observation_id":"35aa94be-e2a4-4b81-aa83-0b824d01744a","resolution":{"observed_at":"2026-08-07T10:18:52.624716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2506.13727","last_updated":"2026-05-07T16:37:45Z","snapshot_observed_at":"2026-07-06T21:43:03.415527Z","submitted_at":"2025-06-16T17:38:36Z","title":"Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T08:52:45.818050Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2506.13727"},"observation_digest":"sha256:184daa2f1a910470e23ac1cebb11f2dbea0bfc3f0da7b57d90672721ecc532ab","observation_id":"0c4f7916-3238-492b-bb86-7a95c6562580","resolution":{"observed_at":"2026-05-19T08:53:04.144810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-06T23:00:19.558832Z","title":"H., Kim, S., Park, J., Yoo, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20251","last_updated":"2025-06-25T08:52:22Z","snapshot_observed_at":"2026-08-07T22:24:27.303298Z","submitted_at":"2025-06-25T08:52:22Z","title":"Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:19.558832Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2506.20251"},"observation_digest":"sha256:835c91a96ac88a930213e3a941d462d88cf44bbf919f95a86e3a13b6797e43a3","observation_id":"53dfb406-e291-4a4b-badf-f4e1a106241a","resolution":{"observed_at":"2026-08-06T23:00:19.558832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-06T20:15:24.158945Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03504","last_updated":"2025-07-14T08:29:19Z","snapshot_observed_at":"2026-08-07T23:39:30.770177Z","submitted_at":"2025-07-04T11:56:16Z","title":"Information-Bottleneck Driven Binary Neural Network for Change Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:24.158945Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2507.03504"},"observation_digest":"sha256:664e90f057bb95685c01ee09ba18558f3804fe80a91620abce95a677213fcb4a","observation_id":"deb9f2da-2284-4ec8-bf66-743303f6bb47","resolution":{"observed_at":"2026-08-06T20:15:24.158945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-06T19:09:14.550295Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07145","last_updated":"2025-07-09T06:04:14Z","snapshot_observed_at":"2026-08-08T02:29:03.615649Z","submitted_at":"2025-07-09T06:04:14Z","title":"CCQ: Convolutional Code for Extreme Low-bit Quantization in LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:09:14.550295Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2507.07145"},"observation_digest":"sha256:15e0064a78a2e83c250f3a50f3d57b7751c18e045d8514b708419ab45647c855","observation_id":"14813428-cb77-415d-9713-4f4d6f3f670b","resolution":{"observed_at":"2026-08-06T19:09:14.550295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-06T11:15:33.956446Z","title":"Squeezellm: Dense-and-sparse quantization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23035","last_updated":"2026-06-02T03:48:06Z","snapshot_observed_at":"2026-08-08T23:08:59.153618Z","submitted_at":"2025-07-30T19:01:25Z","title":"OASIS: Outlier-Aware LUT-Based GEMM with Dual-Side Quantization for LLM Inference Acceleration","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:15:33.956446Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2507.23035"},"observation_digest":"sha256:2abc8b7860a1e74e4c10bcd9266576400181e1dd4d4e45f4ce1719f9dd69f897","observation_id":"e84da4c0-1e3d-4d94-82c6-e8450d5c288a","resolution":{"observed_at":"2026-08-06T11:15:33.956446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-05T15:52:44.950132Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19432","last_updated":"2025-08-26T21:01:45Z","snapshot_observed_at":"2026-08-09T00:35:46.151432Z","submitted_at":"2025-08-26T21:01:45Z","title":"Quantized but Deceptive? A Multi-Dimensional Truthfulness Evaluation of Quantized LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T15:52:44.950132Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2508.19432"},"observation_digest":"sha256:c51c7e38d2fdbc431e5cd3e67c8795d76f3d722170947b6d6c08b8f53c51e1a9","observation_id":"7aa8ef5c-c2e7-459f-b440-804064a16c33","resolution":{"observed_at":"2026-08-05T15:52:44.950132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-03T23:41:52.877669Z","title":"Mahoney, and Kurt Keutzer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04805","last_updated":"2026-07-06T16:04:54Z","snapshot_observed_at":"2026-08-07T10:51:08.099986Z","submitted_at":"2025-11-06T20:53:02Z","title":"PuzzleMoE: Efficient Compression of Large Mixture-of-Experts Models via Sparse Expert Merging and Bit-packed inference","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T23:41:52.877669Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2511.04805"},"observation_digest":"sha256:bf8e84c1fef1a6635e8e01e329b365ef140c908862208f2be23c9bc6f128e1b4","observation_id":"5345532e-07ac-4710-acc3-c0145d49c1b6","resolution":{"observed_at":"2026-08-03T23:41:52.877669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-03T06:38:22.663076Z","title":"Squeezellm:Dense-and-sparsequantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22546","last_updated":"2026-07-31T03:36:38Z","snapshot_observed_at":"2026-08-05T23:10:18.392749Z","submitted_at":"2026-01-30T04:36:09Z","title":"Towards the Holographic Characteristic of LLMs for Efficient Short-text Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:38:22.663076Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2601.22546"},"observation_digest":"sha256:6c231561fc268eaf4ccd6ef7117ca37b890fd2f1a0d1f768151df42bf41bee9a","observation_id":"0985625e-76f9-437f-ad97-54c08b11d733","resolution":{"observed_at":"2026-08-03T06:38:22.663076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2602.05902","last_updated":"2026-05-08T19:18:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-05T17:18:02Z","title":"CoreQ: Learning-Free Mismatch Correction and Successive Rounding for Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T06:51:18.629467Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2602.05902"},"observation_digest":"sha256:431e3c65033d3e6ca9ac69f73c317b03416d7aae6242f42a262e5dc8ca5fc6be","observation_id":"bd74cafc-1369-4735-b1e1-8dc004cf81fc","resolution":{"observed_at":"2026-05-16T06:52:28.393534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2604.20079","last_updated":"2026-04-22T00:53:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T00:53:43Z","title":"On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T00:21:30.101748Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2604.20079"},"observation_digest":"sha256:1d7088ea4dc50aa017e8682abc1a4900c5d62ecaeec112ff9511e152f2d7045a","observation_id":"4f1281b2-6e40-4ab6-8b75-236e1bbd952f","resolution":{"observed_at":"2026-05-10T00:24:47.003271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2604.24008","last_updated":"2026-04-27T03:43:29Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T03:43:29Z","title":"Coverage-Based Calibration for Post-Training Quantization via Weighted Set Cover over Outlier Channels","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:35:02.120009Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2604.24008"},"observation_digest":"sha256:64d64f49aa39ec53f4da023cd4ef3259fe0885340fced90f5eb853d25e87bd70","observation_id":"4de3b8e2-c80f-463d-a5d6-a86773e97d0d","resolution":{"observed_at":"2026-05-11T21:41:16.200257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2604.24273","last_updated":"2026-04-27T10:03:37Z","snapshot_observed_at":"2026-07-06T23:10:20.676482Z","submitted_at":"2026-04-27T10:03:37Z","title":"BitRL: Reinforcement Learning with 1-bit Quantized Language Models for Resource-Constrained Edge Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:23:26.079298Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2604.24273"},"observation_digest":"sha256:e55834df69d0b235db20849027d38cf2be5c4cb47dbdbcaa9e04becb6c00689d","observation_id":"e07df099-eae8-4bee-9a7e-d68669a9ec3a","resolution":{"observed_at":"2026-05-11T21:46:42.443324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.02196","last_updated":"2026-05-08T12:13:19Z","snapshot_observed_at":"2026-08-02T18:15:52.484665Z","submitted_at":"2026-05-04T03:54:14Z","title":"DurableUn: Quantization-Induced Recovery Attacks in Machine Unlearning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T18:49:53.432959Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.02196"},"observation_digest":"sha256:d110ad4ce4794cdfe452a22ff7a8ae353fc95194f48fca9bdd1eacee75311fbe","observation_id":"8f50f0c4-d94e-433f-ab19-6021234e0e44","resolution":{"observed_at":"2026-05-09T06:10:42.160072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.02196","last_updated":"2026-05-08T12:13:19Z","snapshot_observed_at":"2026-08-02T18:15:52.484665Z","submitted_at":"2026-05-04T03:54:14Z","title":"DurableUn: Quantization-Induced Recovery Attacks in Machine Unlearning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:51.021741Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.02196"},"observation_digest":"sha256:32b46bc3de0141e6f9063e298315b406bf865a8ce8ba68e44ba60bd9684157ee","observation_id":"39e3d22d-1c77-4575-9115-5a4f1c462bc9","resolution":{"observed_at":"2026-05-11T01:50:51.165324Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-08-05T23:06:05.311364Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:0a595d793ba5c8958dddb083283993d57ccc89c5c43990899bb3cb80b5aea45a","observation_id":"99e832e7-3ec7-4588-b1ac-415de378cc29","resolution":{"observed_at":"2026-05-11T16:36:08.029916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:fac99bbd0346e7862ecf0627ad55b50f0ec6b40e086fac3358465721e62ca9b7","observation_id":"0d0da963-e2f9-4554-b344-1f115737f3f5","resolution":{"observed_at":"2026-05-11T07:01:10.321373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.04738","last_updated":"2026-05-09T08:06:42Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:35:25Z","title":"OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T18:23:14.935801Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.04738"},"observation_digest":"sha256:b5f3edd75fb98ad37199ccb01e8f45e1076f9338a3932895df5b585e38fbd86f","observation_id":"ee2ac829-f9e2-4fd6-ad98-c96f3e2bc34f","resolution":{"observed_at":"2026-05-09T06:30:44.142303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.04738","last_updated":"2026-05-09T08:06:42Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:35:25Z","title":"OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:59:00.997742Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.04738"},"observation_digest":"sha256:7ad2b54596c0c9887272c18cd3086f59626795541f68bb22c792e10612c72d43","observation_id":"2740b635-abd5-496a-a944-9bdd0dd5b5ea","resolution":{"observed_at":"2026-05-12T03:01:18.210120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.14844","last_updated":"2026-05-14T13:52:31Z","snapshot_observed_at":"2026-08-06T09:00:02.069223Z","submitted_at":"2026-05-14T13:52:31Z","title":"XFP: Quality-Targeted Adaptive Codebook Quantization with Sparse Outlier Separation for LLM Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-30T21:28:36.358474Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.14844"},"observation_digest":"sha256:10b7f653e0583519c90b0d497aa1af83b17e695eaf098c822455b8bea5887ac7","observation_id":"d16da3e7-de78-4192-8548-66862fc2ff1b","resolution":{"observed_at":"2026-06-30T21:35:04.690279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.19929","last_updated":"2026-05-19T14:49:57Z","snapshot_observed_at":"2026-08-02T05:44:37.705586Z","submitted_at":"2026-05-19T14:49:57Z","title":"Breaking Modality Heterogeneity in Low-Bit Quantization for Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:20:45.264341Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.19929"},"observation_digest":"sha256:62b0b673058378bbf656db30491fbbf7b6428a875b772b3efafa6008e77ae9ab","observation_id":"7ec28d36-0207-4a96-98b0-9217129dccff","resolution":{"observed_at":"2026-05-20T05:23:03.625863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.23078","last_updated":"2026-05-21T22:23:38Z","snapshot_observed_at":"2026-08-02T10:30:48.658412Z","submitted_at":"2026-05-21T22:23:38Z","title":"GEMQ: Global Expert-Level Mixed-Precision Quantization for MoE LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:33:06.719954Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.23078"},"observation_digest":"sha256:54f1ad3f7b4cbe3399a42740e53305a88786609794bb0fdb91391dc7dd1ac7a9","observation_id":"9bd3ab0c-6349-4222-a3c0-7f1dfd3eba6d","resolution":{"observed_at":"2026-05-25T05:36:39.872360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.24011","last_updated":"2026-08-03T19:37:08Z","snapshot_observed_at":"2026-08-07T23:09:27.552514Z","submitted_at":"2026-05-19T19:57:26Z","title":"ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T17:54:56.386488Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.24011"},"observation_digest":"sha256:0ec6f1978cacc9de87f4860fd67589370075764d959582ac1dbb8a30eab2e54f","observation_id":"bf0cc52c-1c31-4da3-9a8e-9cba87bf348f","resolution":{"observed_at":"2026-06-30T18:04:58.491515Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2606.00535","last_updated":"2026-05-30T05:05:24Z","snapshot_observed_at":"2026-08-09T01:45:13.939348Z","submitted_at":"2026-05-30T05:05:24Z","title":"DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-28T18:55:51.474956Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2606.00535"},"observation_digest":"sha256:4bf18bf01ea690426f1f66f80ccf13c34b57f8e91639bd252ed4fd4fa1578c9d","observation_id":"9f262736-e8cc-4a2d-ada2-88c261a3f7b2","resolution":{"observed_at":"2026-06-28T19:02:34.617720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2606.01412","last_updated":"2026-05-31T19:17:39Z","snapshot_observed_at":"2026-08-05T23:04:35.966323Z","submitted_at":"2026-05-31T19:17:39Z","title":"GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T17:28:14.160341Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2606.01412"},"observation_digest":"sha256:0976ffd5d86766a971c89299e14e3bdbf76bf48c34dca4cc4d3bdf33d5a551d3","observation_id":"d4b4ba6f-6db8-4589-807f-f054a40c3feb","resolution":{"observed_at":"2026-07-01T21:06:14.475000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2606.05429","last_updated":"2026-06-03T20:51:52Z","snapshot_observed_at":"2026-08-06T01:16:12.101022Z","submitted_at":"2026-06-03T20:51:52Z","title":"Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T06:09:42.838355Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2606.05429"},"observation_digest":"sha256:4d49e4522d1682431688ead10038697957902fc1a19754811dbe861861db17c1","observation_id":"cb5672a2-5a67-43de-ac03-95457cefd64a","resolution":{"observed_at":"2026-07-02T08:16:48.293704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2606.28438","last_updated":"2026-06-26T07:35:43Z","snapshot_observed_at":"2026-08-03T00:04:55.169727Z","submitted_at":"2026-06-26T07:35:43Z","title":"When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-30T01:29:42.919461Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2606.28438"},"observation_digest":"sha256:6046a25f6d41df0bcabddc00712c61e9bcc5e1f89787df181c04a9bb4506b6aa","observation_id":"cc0d0cdb-359f-4fbf-a642-c00e4281e965","resolution":{"observed_at":"2026-07-01T15:25:48.408417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-08-05T09:51:09.302562Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:1d42bd1274881d0d8eaa56af32c289f1273cc6cac644dee042e300454b54592a","observation_id":"1bac6c64-6ee8-4ee4-a0bd-310a5e10279c","resolution":{"observed_at":"2026-07-02T15:57:06.403971Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2607.01876","last_updated":"2026-07-02T08:30:00Z","snapshot_observed_at":"2026-08-08T03:00:25.897057Z","submitted_at":"2026-07-02T08:30:00Z","title":"SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T16:14:03.717787Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.01876"},"observation_digest":"sha256:0cda4087b4ac864b91f3b8650181240b0580b42d4d84a3649970ea852b6b88c3","observation_id":"807090fd-1b0e-484d-b714-c291eb299548","resolution":{"observed_at":"2026-07-03T16:18:37.341488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2607.02461","last_updated":"2026-07-02T17:27:34Z","snapshot_observed_at":"2026-08-08T00:39:10.240945Z","submitted_at":"2026-07-02T17:27:34Z","title":"OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-03T14:56:10.553212Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.02461"},"observation_digest":"sha256:07f7b0baf2ba8f080fc6984f5881d889ee07cb855a345bda9e733ef3821d040d","observation_id":"0e56bdc7-8bc2-4799-9fed-944eb3b39dbb","resolution":{"observed_at":"2026-07-03T14:58:32.417750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:b1808e1e35b2fe26e21f7eec65d0cd8a7fb0830fc81aff8f9a88e9d19e94c7f4","observation_id":"91ab3514-5ab9-417b-bd6b-a58cc4aea220","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-01T17:12:27.941291Z","title":"arXiv preprint arXiv:2306.07629 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17733","last_updated":"2026-07-20T09:23:10Z","snapshot_observed_at":"2026-08-08T01:05:12.635413Z","submitted_at":"2026-07-20T09:23:10Z","title":"MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T17:12:27.941291Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.17733"},"observation_digest":"sha256:3f5bafa14c439e131ba05fdcd50348009a4894e84d9aab7d60f64674c4727c9c","observation_id":"25b40a43-1701-4822-b146-c3fd2fdc511c","resolution":{"observed_at":"2026-08-01T17:12:27.941291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-01T12:04:14.348367Z","title":"SqueezeLLM: Dense -and-sparse quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19676","last_updated":"2026-07-22T02:25:46Z","snapshot_observed_at":"2026-08-08T09:08:45.735619Z","submitted_at":"2026-07-22T02:25:46Z","title":"Edge Intelligence in Civil Aviation: Paradigms, Techniques, and Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:04:14.348367Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.19676"},"observation_digest":"sha256:dcd7e67a0a62dbb327ed0c01161e9386aa33b4ac63d9bf3bd34c62d22ed3ce49","observation_id":"a32228b5-c235-4152-960b-a3ebecdb9bf7","resolution":{"observed_at":"2026-08-01T12:04:14.348367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-08T00:50:44.530504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04048","last_updated":"2026-08-04T08:32:05Z","snapshot_observed_at":"2026-08-09T15:54:35.807233Z","submitted_at":"2026-08-04T08:32:05Z","title":"Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:50:44.530504Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2608.04048"},"observation_digest":"sha256:59b5a395f7bcd4faf2d0d291fc4f347cf13e9e654dc59664f31d55f2ab15961a","observation_id":"c46894f7-5422-494f-8ba4-abcadcbcafc3","resolution":{"observed_at":"2026-08-08T00:50:44.530504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.07629/citation-record","integrity":"/paper/2306.07629/integrity","json":"/paper/2306.07629/citation-record.json","paper":"/paper/2306.07629"},"outbound":[],"paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 54 inbound Pith citation observations for arXiv:2306.07629."}