{"as_of":"2026-08-19T15:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3339fcb8d70f056d3cacf614a5077c89ffaa9f74096f73f1d5048cc8fd9a91ca","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:26:51.778411Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12026/citation-record","integrity":"/paper/2608.12026/integrity","json":"/paper/2608.12026/citation-record.json","paper":"/paper/2608.12026"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.02638","last_updated":"2026-04-03T02:03:38Z","snapshot_observed_at":"2026-08-11T14:15:28.039447Z","submitted_at":"2026-04-03T02:03:38Z","title":"AXELRAM: Quantize Once, Never Dequantize","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02638","snapshot_observed_at":"2026-08-16T00:26:51.500088Z","title":"doi:10.48550/arXiv.2604.02638 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.500088Z"},"links":{"cited_paper":"/paper/2604.02638","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:f0fcd39ede517a0a3614f300182f773c9dba9dc7d3ab6e4e1b45df09e2d04b61","observation_id":"d23ad11c-ac73-4c34-8ebe-2034a1314552","resolution":{"observed_at":"2026-08-16T00:26:51.500088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-14T14:45:14.744168Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19874","snapshot_observed_at":"2026-08-16T00:26:51.504805Z","title":"doi:10.48550/arXiv.2504.19874 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.504805Z"},"links":{"cited_paper":"/paper/2504.19874","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:6f061ff1a198dc5427aded54c4016e4bafeb0d7b9d17fde2917b401cd48c8c47","observation_id":"2b86eb8a-201c-4f20-a999-e14b9a084ba2","resolution":{"observed_at":"2026-08-16T00:26:51.504805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03482","last_updated":"2024-07-18T16:31:29Z","snapshot_observed_at":"2026-08-16T13:45:47.534365Z","submitted_at":"2024-06-05T17:42:05Z","title":"QJL: 1-Bit Quantized JL Transform for KV Cache Quantization with Zero Overhead","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03482","snapshot_observed_at":"2026-08-16T00:26:51.509442Z","title":"doi:10.48550/arXiv.2406.03482 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.509442Z"},"links":{"cited_paper":"/paper/2406.03482","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:1850151cc413435126f3077d96920052835f72826a29fc186286d18297b0169e","observation_id":"a4ee110a-22d5-442b-8012-e351fb0510af","resolution":{"observed_at":"2026-08-16T00:26:51.509442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-18T00:51:28.727325Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-16T00:26:51.513703Z","title":"Transformers are","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.513703Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:28946fd1983a02a5e6a1d5296a2c3cf07d116a9ac63e8f789f65d82544f0d8ed","observation_id":"1b6a5747-1954-4ae4-bf7c-4c3d28b66a8a","resolution":{"observed_at":"2026-08-16T00:26:51.513703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-16T00:26:51.518037Z","title":"Transformers are","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.518037Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:e6f40dff5deb76fbf9b6847353fdbf4fa4ffcb864b09763ea7443024ab29aeb3","observation_id":"235f8011-2932-4530-a385-a1158e7055cd","resolution":{"observed_at":"2026-08-16T00:26:51.518037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T00:26:51.522547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.522547Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:b117e5895e63987d0d79b07c06c219f42f7c0090b5cb814ffb5859bb88ff18ab","observation_id":"b2766b5d-917f-4429-9267-a68cece3f823","resolution":{"observed_at":"2026-08-16T00:26:51.522547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2508.01077","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:53.037701Z","title":null,"venue":null,"work_id":"376542e1-934f-4048-98ad-124f132d1b6c","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.526747Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:bf6a85f6af549e0e4ecc357c2bcaaa97e26755ff346abbba77e6b1afe55874aa","observation_id":"5663b2f8-f976-49f4-b2b9-c8df948b83c0","resolution":{"observed_at":"2026-08-16T00:26:53.041368Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.531203Z","title":"Dissecting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.531203Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:dc3df08c75e6b02a5f79b110f87766b252a2130d0f26312f372638b52c352bca","observation_id":"a7cc9b04-0212-42f1-861a-cc6d3e373acd","resolution":{"observed_at":"2026-08-16T00:26:51.531203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2511.04063","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:52.910558Z","title":"doi:10.48550/arXiv.2511.04063 , abstract =","venue":null,"work_id":"83a2d6d6-6d7d-49aa-bbca-a010c838d60b","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.535210Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:efdf02cd9373cef1b2443745fa97ba069ada52ec0a9fae3442236e7f75d10e9d","observation_id":"a87882a0-d631-46a5-aa02-dfc168befcf4","resolution":{"observed_at":"2026-08-16T00:26:52.914324Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2511.10645","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:52.840342Z","title":"doi:10.48550/arXiv.2511.10645 , abstract =","venue":null,"work_id":"e51b9b73-5455-428e-8e2c-9222f48bd78b","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.538852Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:120a7a0b96791045b2902b68123e81739dc2d206a995e0cd7de11a990e9991c9","observation_id":"d2b58a0a-0968-473b-a683-e1feb7c4afe9","resolution":{"observed_at":"2026-08-16T00:26:52.844119Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-08-16T17:18:05.876361Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-16T00:26:51.543169Z","title":"doi:10.48550/arXiv.2405.16406 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.543169Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:71288f6402645cf70b1a3f6e479fecfc2339e832ef452063ed576872e6413d2c","observation_id":"97d65aba-40d7-4841-b922-d8b2986223cf","resolution":{"observed_at":"2026-08-16T00:26:51.543169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.547272Z","title":"doi:10.13140/RG.2.2.28167.37282 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.547272Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:0f9b36d790978aa9146ce978e366b9e93828f14df5861bcae0ec98154758443c","observation_id":"caf38226-9d49-482e-952b-e44c219443e1","resolution":{"observed_at":"2026-08-16T00:26:51.547272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06147","last_updated":"2024-06-02T02:48:05Z","snapshot_observed_at":"2026-08-18T07:38:48.627651Z","submitted_at":"2024-05-10T00:06:02Z","title":"State-Free Inference of State-Space Models: The Transfer Function Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06147","snapshot_observed_at":"2026-08-16T00:26:51.550784Z","title":"and Massaroli, Stefano and Moro, Alessandro and Smith, Jimmy T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.550784Z"},"links":{"cited_paper":"/paper/2405.06147","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:f704be63a5bb7acdbe625513099a07a17584957e1d8de5563adc89e1075030f7","observation_id":"87d1159e-4129-4b3d-921a-5cd31ba1d80a","resolution":{"observed_at":"2026-08-16T00:26:51.550784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-16T14:04:57.666315Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-16T00:26:51.554740Z","title":"and Li, Bo and Cameron, Pashmina and Jaggi, Martin and Alistarh, Dan and Hoefler, Torsten and Hensman, James , month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.554740Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:9f0e2a518c0ed20b6d4d85eb56d29733884756b90a3a1d794a831eabdfada1dd","observation_id":"087e4c9f-a18b-4f6b-b0b0-cc6c0789185e","resolution":{"observed_at":"2026-08-16T00:26:51.554740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-16T00:26:51.558596Z","title":"doi:10.48550/arXiv.2306.00978 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.558596Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:a146b260e3aa6d272d42c1a3a58f39aa9e263316d8bc535b128feb7f899f4abc","observation_id":"831da614-fa9b-4ee5-9cad-f063f484c55e","resolution":{"observed_at":"2026-08-16T00:26:51.558596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11580","last_updated":"2023-01-08T11:49:36Z","snapshot_observed_at":"2026-08-16T16:37:09.174107Z","submitted_at":"2022-08-24T14:33:35Z","title":"Optimal Brain Compression: A Framework for Accurate Post-Training Quantization and Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11580","snapshot_observed_at":"2026-08-16T00:26:51.562222Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.562222Z"},"links":{"cited_paper":"/paper/2208.11580","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:f958e79e5d355fb0d5104e62ad49db4b317b00bf4036de8f0e28baa3f08b17c8","observation_id":"e1c4e79b-6d5f-4fa9-bc71-0e09d4070e1a","resolution":{"observed_at":"2026-08-16T00:26:51.562222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-16T00:26:51.566355Z","title":"doi:10.48550/arXiv.2210.17323 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.566355Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:86ce199df9df882b3f7e69b36d076f3811868b59ca2ab1dc1fcb3f44eb0b31e3","observation_id":"24b5c727-5a02-4075-92e2-fabc432917ce","resolution":{"observed_at":"2026-08-16T00:26:51.566355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13304","last_updated":"2024-01-15T21:54:28Z","snapshot_observed_at":"2026-08-18T08:36:45.091453Z","submitted_at":"2023-07-25T07:44:06Z","title":"QuIP: 2-Bit Quantization of Large Language Models With Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13304","snapshot_observed_at":"2026-08-16T00:26:51.570859Z","title":"doi:10.48550/arXiv.2307.13304 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.570859Z"},"links":{"cited_paper":"/paper/2307.13304","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:9b09264bc8283a8156cfaac80f2e5d6b9e98f4d591c71f6951cb2436c32dacfa","observation_id":"3539eb1d-cc1c-4224-804f-874405855c10","resolution":{"observed_at":"2026-08-16T00:26:51.570859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04396","last_updated":"2024-06-04T04:51:52Z","snapshot_observed_at":"2026-08-18T15:55:18.958104Z","submitted_at":"2024-02-06T20:52:12Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04396","snapshot_observed_at":"2026-08-16T00:26:51.575124Z","title":"doi:10.48550/arXiv.2402.04396 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.575124Z"},"links":{"cited_paper":"/paper/2402.04396","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:1ea408e9bde361fff1741c266cdb84afcf8d34db156e299bd0c5bce778c7be05","observation_id":"3d65f970-4d23-4d0e-a014-63b7c6df67a4","resolution":{"observed_at":"2026-08-16T00:26:51.575124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2511.07842","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:52.689267Z","title":"Alignment-","venue":null,"work_id":"f949f576-9f0e-4e59-a935-e30173167791","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.579166Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:2c9227ce00070dd82aa8dcec5b2ed9afcd4c6ae9f3739c7ceb929cdf50d34a89","observation_id":"21c60d54-ce2e-48c9-8cd4-b389263751a6","resolution":{"observed_at":"2026-08-16T00:26:52.693420Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16454","last_updated":"2025-03-21T06:37:37Z","snapshot_observed_at":"2026-08-19T03:55:20.682101Z","submitted_at":"2024-10-21T19:28:37Z","title":"Catastrophic Failure of LLM Unlearning via Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16454","snapshot_observed_at":"2026-08-16T00:26:51.583018Z","title":"Catastrophic","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.583018Z"},"links":{"cited_paper":"/paper/2410.16454","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:28bb59b0f1a62d511e83c999c79cf204880daa6fb22615f8e16bb1c35cc13501","observation_id":"ed628f4e-df81-4a71-a841-828e89b04848","resolution":{"observed_at":"2026-08-16T00:26:51.583018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.586838Z","title":"and Colombo, Maurizio and Damiani, Ernesto and Asal, Rasool and Almemari, Al Anoud and Alhammadi, Yousof , month = dec, year =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.586838Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:7031759921e062ce6a07c6f3edf909e1beec8fc644ef2e24836a13568cf2f9b0","observation_id":"5c93bedd-ff1c-4c83-b3a4-13aa4f6ab65b","resolution":{"observed_at":"2026-08-16T00:26:51.586838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11235","last_updated":"2025-06-18T02:49:59Z","snapshot_observed_at":"2026-08-16T13:42:25.847371Z","submitted_at":"2024-06-17T06:03:13Z","title":"QTIP: Quantization with Trellises and Incoherence Processing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11235","snapshot_observed_at":"2026-08-16T00:26:51.590478Z","title":"doi:10.48550/arXiv.2406.11235 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.590478Z"},"links":{"cited_paper":"/paper/2406.11235","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:07919e289f44685a9a767f21167b484373439744ca398ca6e10bd472097e98dd","observation_id":"36add2ab-5b41-4b9e-935b-7dca4107d409","resolution":{"observed_at":"2026-08-16T00:26:51.590478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-16T00:26:51.594380Z","title":"doi:10.48550/arXiv.2305.14314 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.594380Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:04c61656074d2638057a350800a663fe5a354293882dc71ff516bcbef1d7dba2","observation_id":"28cce917-4049-48f3-9968-73e21502bab9","resolution":{"observed_at":"2026-08-16T00:26:51.594380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-16T00:26:51.598410Z","title":"doi:10.48550/arXiv.2208.07339 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.598410Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:27bc66d58a1243be3dd9d7d14628c3b4c51905d78d3e2f30c7a7e5fec4ba99e8","observation_id":"ccb1293b-471a-47cc-b055-fd365cefbbab","resolution":{"observed_at":"2026-08-16T00:26:51.598410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-19T11:18:42.832498Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-16T00:26:51.602354Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.602354Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:c54258c485d5427ac77902bcd5ea3dfec238accaf4181f6b54dc8bc0a3492206","observation_id":"19507ccb-c5c4-4a5b-b5aa-0353fc2272f0","resolution":{"observed_at":"2026-08-16T00:26:51.602354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13545","last_updated":"2023-04-26T13:13:04Z","snapshot_observed_at":"2026-08-16T15:37:32.641934Z","submitted_at":"2023-04-26T13:13:04Z","title":"Killing Two Birds with One Stone: Quantization Achieves Privacy in Distributed Learning","version":1},"cited_work":{"arxiv_id":"2304.13545","doi":"10.48550/arxiv.2304.13545","metadata_source":"pith","pith_arxiv_id":"2304.13545","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"Killing Two Birds with One Stone: Quantization Achieves Privacy in Distributed Learning","venue":"cs.LG","work_id":"837ade44-b23e-4724-9209-7b8f7345f721","year":2023},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.606515Z"},"links":{"cited_paper":"/paper/2304.13545","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:79bb078d4ba6b52d496230e871cc104748f0f99b553c0528711cc86b923fe212","observation_id":"af8f2fe6-fa14-4a05-b213-4163f423ebaf","resolution":{"observed_at":"2026-08-16T00:26:52.563153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-13T17:08:54.114895Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-16T00:26:51.610461Z","title":"Recipes for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.610461Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:3db74e4d2f307e22401ed8971f9c6ff04bbcf436fe5c624682ea510a38ec069a","observation_id":"74a6596e-74ea-4225-8938-7d94d2bdf475","resolution":{"observed_at":"2026-08-16T00:26:51.610461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.614400Z","title":"Pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.614400Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:759d2fabbceb584ea45170faec8a899e22cb4fc3b914c42fa64ff027b5ddf567","observation_id":"db3b9bd9-9be9-461c-8789-c16c952a9579","resolution":{"observed_at":"2026-08-16T00:26:51.614400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-16T16:15:00.962632Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-16T00:26:51.618005Z","title":"doi:10.48550/arXiv.2211.10438 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.618005Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:35f8f9a8b3453760e41e6ffaa7d8c83c7c15cc9c458afe2305512f7343fc8f10","observation_id":"3636cfac-6dc4-4c69-8671-613198abb1dc","resolution":{"observed_at":"2026-08-16T00:26:51.618005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.11177","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:52.496273Z","title":null,"venue":null,"work_id":"ec1d9903-ffe2-4650-be2b-4af3009d8608","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.622002Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:ebf244db14c1ce28bd396224aaebd49dee50f22e725a1e0a7087e521580a0004","observation_id":"d9e3e1fb-59bf-4c8b-a7aa-d605dfa6987d","resolution":{"observed_at":"2026-08-16T00:26:52.500001Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10568","last_updated":"2020-06-30T09:51:23Z","snapshot_observed_at":"2026-08-12T19:59:54.746291Z","submitted_at":"2020-04-22T13:44:28Z","title":"Up or Down? Adaptive Rounding for Post-Training Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10568","snapshot_observed_at":"2026-08-16T00:26:51.626399Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.626399Z"},"links":{"cited_paper":"/paper/2004.10568","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:1552472a7ba77bd8cb51af61b45a36f6530ff78fe2fb847c4060ef97a1015b8b","observation_id":"2e73f742-8acc-4034-aea7-93e1458efc6e","resolution":{"observed_at":"2026-08-16T00:26:51.626399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09616","last_updated":"2025-07-13T12:48:46Z","snapshot_observed_at":"2026-08-17T04:37:42.869860Z","submitted_at":"2025-07-13T12:48:46Z","title":"MLoRQ: Bridging Low-Rank and Quantization for Transformer Compression","version":1},"cited_work":{"arxiv_id":"2507.09616","doi":"10.48550/arxiv.2507.09616","metadata_source":"pith","pith_arxiv_id":"2507.09616","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"MLoRQ: Bridging Low-Rank and Quantization for Transformer Compression","venue":"cs.LG","work_id":"3b716566-8dfd-4cfc-8ede-4d50d2b532df","year":2025},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.630883Z"},"links":{"cited_paper":"/paper/2507.09616","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:aa9fbcf41ab3159450ad7fc9e90b787db81a8552192a5a2111cced5fbc2f0871","observation_id":"4e2d3b31-60ab-4525-ba3a-e70eaa4e5e4d","resolution":{"observed_at":"2026-08-16T00:26:52.425831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09615","last_updated":"2025-08-14T23:13:36Z","snapshot_observed_at":"2026-08-16T13:10:00.738125Z","submitted_at":"2024-10-12T18:36:07Z","title":"SLiM: One-shot Quantization and Sparsity with Low-rank Approximation for LLM Weight Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09615","snapshot_observed_at":"2026-08-16T00:26:51.634894Z","title":"doi:10.48550/arXiv.2410.09615 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.634894Z"},"links":{"cited_paper":"/paper/2410.09615","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:fba6d54db35dde5054792ad1700d9ea69c6c5795b00b28f91dbd3e150545844d","observation_id":"b0169f28-116a-4918-bb90-a3924ce3dbd9","resolution":{"observed_at":"2026-08-16T00:26:51.634894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09720","last_updated":"2025-07-26T15:13:56Z","snapshot_observed_at":"2026-08-14T09:06:18.624176Z","submitted_at":"2025-02-13T19:11:40Z","title":"NestQuant: Nested Lattice Quantization for Matrix Products and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09720","snapshot_observed_at":"2026-08-16T00:26:51.638644Z","title":"doi:10.48550/arXiv.2502.09720 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.638644Z"},"links":{"cited_paper":"/paper/2502.09720","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:1e2c03bd5833eb791c9b979205088367fbee2b9604fa706244ec5c4d51046481","observation_id":"4013b1a7-1956-40f5-abfc-d00e97b20717","resolution":{"observed_at":"2026-08-16T00:26:51.638644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02692","last_updated":"2025-05-13T17:54:56Z","snapshot_observed_at":"2026-08-16T12:44:13.286364Z","submitted_at":"2025-04-03T15:30:43Z","title":"GPTAQ: Efficient Finetuning-Free Quantization for Asymmetric Calibration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02692","snapshot_observed_at":"2026-08-16T00:26:51.642528Z","title":"doi:10.48550/arXiv.2504.02692 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.642528Z"},"links":{"cited_paper":"/paper/2504.02692","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:a97e16e38924249b92b309c654b406485f55e364ebc9d8576155518e9a07e671","observation_id":"ade6ce60-90a3-4f87-939f-0291b703176d","resolution":{"observed_at":"2026-08-16T00:26:51.642528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07955","last_updated":"2026-04-09T08:20:59Z","snapshot_observed_at":"2026-08-11T08:12:25.572641Z","submitted_at":"2026-04-09T08:20:59Z","title":"Rethinking Residual Errors in Compensation-based LLM Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07955","snapshot_observed_at":"2026-08-16T00:26:51.646615Z","title":"Rethinking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.646615Z"},"links":{"cited_paper":"/paper/2604.07955","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:828b2de1344afb0474ec158057c1c84324b82d874f5ab85ce94571a27267d2ff","observation_id":"26bc2b3a-4cd1-406e-b065-8706d7b8fb36","resolution":{"observed_at":"2026-08-16T00:26:51.646615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.04956","last_updated":"2026-06-01T21:28:01Z","snapshot_observed_at":"2026-08-14T15:29:47.425031Z","submitted_at":"2026-03-05T08:50:58Z","title":"WaterSIC: Information-Theoretically (Near) Optimal Linear Layer Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.04956","snapshot_observed_at":"2026-08-16T00:26:51.650581Z","title":"doi:10.48550/arXiv.2603.04956 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.650581Z"},"links":{"cited_paper":"/paper/2603.04956","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:8106d13fa2d3c501f0ac8f180904558532888eb1896f3667a058b5b4d0d39d4f","observation_id":"2d4e0277-9f39-4269-bd06-bd8485746398","resolution":{"observed_at":"2026-08-16T00:26:51.650581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-16T00:26:51.654544Z","title":"doi:10.48550/arXiv.2305.13245 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.654544Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:b20a66ff149aac2977a0fb29d8a41b6ee0e087b1d06b2633b3f9ce1c93de434a","observation_id":"3b6534d7-e62d-4c74-bf4e-84377acf9c71","resolution":{"observed_at":"2026-08-16T00:26:51.654544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08659","last_updated":"2023-11-28T16:06:59Z","snapshot_observed_at":"2026-08-16T21:20:07.431044Z","submitted_at":"2023-10-12T18:34:08Z","title":"LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08659","snapshot_observed_at":"2026-08-16T00:26:51.658533Z","title":"doi:10.48550/arXiv.2310.08659 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.658533Z"},"links":{"cited_paper":"/paper/2310.08659","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:d5399eb7d9be621b698dfaaa94c11b06e39c1054bc40fca7bc93c2f09744b885","observation_id":"1be444a1-20c3-480d-afd0-44bccfaf8617","resolution":{"observed_at":"2026-08-16T00:26:51.658533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.22944","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:52.340914Z","title":"and Bich, Philippe and Zhuang, Jiawei and Çelik, Ahmet and Benfenati, Luca and Cavigelli, Lukas , month = jan, year =","venue":null,"work_id":"077f371c-fcf0-4dab-a718-42fb8709b9d3","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.663885Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:ece8e116e305e0d6b84c24ccee873d281865bc27d30da85ce17085b338e1395f","observation_id":"2d9b3d8e-5cc4-473a-a2e8-45b1615d9559","resolution":{"observed_at":"2026-08-16T00:26:52.344767Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07191","last_updated":"2025-07-07T17:42:19Z","snapshot_observed_at":"2026-08-16T13:01:04.512906Z","submitted_at":"2024-11-11T18:05:48Z","title":"The Super Weight in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07191","snapshot_observed_at":"2026-08-16T00:26:51.667494Z","title":"and Wan, Alvin , month = jul, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.667494Z"},"links":{"cited_paper":"/paper/2411.07191","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:308137c3d25e0fbeb7669c9a10d697a1a5427b8a1b2d76ecb0aceb686a79892d","observation_id":"993250b8-cdda-4420-a0bc-670ead4e7926","resolution":{"observed_at":"2026-08-16T00:26:51.667494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-08-16T07:45:21.406264Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-16T00:26:51.671329Z","title":"Zico and Liu, Zhuang , month = aug, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.671329Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:aa2bbad74e25ad11421b616b9c490d5234ea3d515d821e98829a28402c137718","observation_id":"3756099b-bceb-44ae-b4ba-7ae27cd418c1","resolution":{"observed_at":"2026-08-16T00:26:51.671329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02272","last_updated":"2024-01-24T02:53:27Z","snapshot_observed_at":"2026-08-16T15:26:49.661873Z","submitted_at":"2023-06-04T06:33:13Z","title":"OWQ: Outlier-Aware Weight Quantization for Efficient Fine-Tuning and Inference of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02272","snapshot_observed_at":"2026-08-16T00:26:51.675323Z","title":"doi:10.48550/arXiv.2306.02272 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.675323Z"},"links":{"cited_paper":"/paper/2306.02272","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:8880d76fbe8d454957debddf3b68fab74e089b87888d655004576a67e3f1ce17","observation_id":"e1585feb-4a47-4952-98c2-ddb46aae4078","resolution":{"observed_at":"2026-08-16T00:26:51.675323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-16T00:26:51.679402Z","title":"Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.679402Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:5158324b90fd36812319388c46efc4c84528d8879a49ce71b10fc0e0818e2c93","observation_id":"f9c5dd66-575a-4b60-b814-0b88228afa18","resolution":{"observed_at":"2026-08-16T00:26:51.679402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12016","last_updated":"2024-10-04T06:26:20Z","snapshot_observed_at":"2026-08-16T13:42:05.922451Z","submitted_at":"2024-06-17T18:33:44Z","title":"Prefixing Attention Sinks can Mitigate Activation Outliers for Large Language Model Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12016","snapshot_observed_at":"2026-08-16T00:26:51.684121Z","title":"Prefixing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.684121Z"},"links":{"cited_paper":"/paper/2406.12016","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:ac7b9e0b97c9d0a86764baad54461e9dad40fe796e30a63800e62fa73bc5aff1","observation_id":"aa933d45-7c55-40f8-acb6-a0d17c2b0c51","resolution":{"observed_at":"2026-08-16T00:26:51.684121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01563","last_updated":"2025-05-20T18:08:40Z","snapshot_observed_at":"2026-08-18T19:38:43.990524Z","submitted_at":"2025-02-03T17:47:03Z","title":"Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01563","snapshot_observed_at":"2026-08-16T00:26:51.687990Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.687990Z"},"links":{"cited_paper":"/paper/2502.01563","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:82e6cdd0147c748497d23e3c43aa78576e81c7aaee70bab1ba51fcc55de90937","observation_id":"f91ee2ba-c361-4795-b166-3c2d3b8d50a2","resolution":{"observed_at":"2026-08-16T00:26:51.687990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06205","last_updated":"2025-05-13T14:11:59Z","snapshot_observed_at":"2026-08-16T13:11:25.569465Z","submitted_at":"2024-10-08T17:07:01Z","title":"Round and Round We Go! What makes Rotary Positional Encodings useful?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06205","snapshot_observed_at":"2026-08-16T00:26:51.691945Z","title":"Round and","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.691945Z"},"links":{"cited_paper":"/paper/2410.06205","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:ab5e55d7d1d015d02999da43e7c73afaba7f5baeb0499922477e4c0829fb6cef","observation_id":"49f88765-0c58-4e08-906e-aae74434e448","resolution":{"observed_at":"2026-08-16T00:26:51.691945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17388","last_updated":"2026-06-23T17:12:17Z","snapshot_observed_at":"2026-08-15T03:11:50.414827Z","submitted_at":"2025-11-21T16:50:00Z","title":"Selective Rotary Position Embedding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17388","snapshot_observed_at":"2026-08-16T00:26:51.696105Z","title":"Selective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.696105Z"},"links":{"cited_paper":"/paper/2511.17388","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:2a5f8d71a69973d0b86b9cf5e39386ad34324c9d551dba789ae0bfb73132c139","observation_id":"8e031988-e728-467b-afc3-bde3ec8892f7","resolution":{"observed_at":"2026-08-16T00:26:51.696105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14591","last_updated":"2024-05-23T14:03:31Z","snapshot_observed_at":"2026-08-16T13:50:11.559449Z","submitted_at":"2024-05-23T14:03:31Z","title":"Base of RoPE Bounds Context Length","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14591","snapshot_observed_at":"2026-08-16T00:26:51.699966Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.699966Z"},"links":{"cited_paper":"/paper/2405.14591","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:ae9ddfa5335b9112f47c8212e4f51f5fea58f3df45e75bac18fb51b283355507","observation_id":"9ca675b6-9056-4e84-b843-023de9cb0037","resolution":{"observed_at":"2026-08-16T00:26:51.699966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29756","last_updated":"2026-05-28T11:02:23Z","snapshot_observed_at":"2026-08-16T06:02:24.555038Z","submitted_at":"2026-05-28T11:02:23Z","title":"LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs","version":1},"cited_work":{"arxiv_id":"2605.29756","doi":"10.48550/arxiv.2605.29756","metadata_source":"pith","pith_arxiv_id":"2605.29756","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs","venue":"cs.AI","work_id":"32f49da3-746c-4c58-a1e2-03bb8cd9e52e","year":2026},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.703987Z"},"links":{"cited_paper":"/paper/2605.29756","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:e699d4cb60530dea2491d07e090072c2656fe3a097ff1f7f6cbf3cbf0f0997a6","observation_id":"507c1f6e-ec95-4dfa-b3dd-21e28d38e172","resolution":{"observed_at":"2026-08-16T00:26:52.179385Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10202","last_updated":"2025-05-15T11:58:04Z","snapshot_observed_at":"2026-08-15T21:12:07.569655Z","submitted_at":"2025-05-15T11:58:04Z","title":"VQ-Logits: Compressing the Output Bottleneck of Large Language Models via Vector Quantized Logits","version":1},"cited_work":{"arxiv_id":"2505.10202","doi":"10.48550/arxiv.2505.10202","metadata_source":"pith","pith_arxiv_id":"2505.10202","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"VQ-Logits: Compressing the Output Bottleneck of Large Language Models via Vector Quantized Logits","venue":"cs.CL","work_id":"1fc30a2d-71d2-493f-9cbd-447b4a91e43d","year":2025},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.707959Z"},"links":{"cited_paper":"/paper/2505.10202","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:3c25c3f5aa7ff136eb087097b0e7cf9ec03e70b88c3ef2a71ad1a894ff3336c4","observation_id":"985d0610-4d2d-4a68-92e6-acb10f7dc5cf","resolution":{"observed_at":"2026-08-16T00:26:52.160396Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.14591","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:52.142413Z","title":"doi:10.48550/arXiv.2603.14591 , abstract =","venue":null,"work_id":"c347f6ba-25a7-4a2a-855b-e692d6ff3bd9","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.712012Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:f480e805d9eaf59b26159d1d29456a424adee1942ef488772b035756eb2c5dce","observation_id":"49d27bf2-290a-4511-8082-8ad6c7caf822","resolution":{"observed_at":"2026-08-16T00:26:52.145900Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-16T15:05:54.961547Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-16T00:26:51.715866Z","title":"doi:10.48550/arXiv.2308.13137 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.715866Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:2363f3dc98204d14c83758f0686e2870e408253f29e01a9b592c3f302a35464e","observation_id":"ca14a1bc-e680-4ae9-bc85-9b6c6aff31e2","resolution":{"observed_at":"2026-08-16T00:26:51.715866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04309","last_updated":"2017-06-19T16:33:04Z","snapshot_observed_at":"2026-08-14T21:39:52.788731Z","submitted_at":"2016-09-14T15:15:08Z","title":"Efficient softmax approximation for GPUs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04309","snapshot_observed_at":"2026-08-16T00:26:51.719917Z","title":"Efficient softmax approximation for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.719917Z"},"links":{"cited_paper":"/paper/1609.04309","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:180beb7ed256c1a983e18b0bc4cff7a788ea37c83609fbc6a7aed5d5dec2e225","observation_id":"8a5b88ee-d84b-44d9-8265-e6561511cb08","resolution":{"observed_at":"2026-08-16T00:26:51.719917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-16T00:26:51.723834Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.723834Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:669d3acbdbdc80ae55030ada004a9c1b7efadad449be79710272cec6ee236e16","observation_id":"254ee6af-47ac-4045-91d5-99b157a0eb0d","resolution":{"observed_at":"2026-08-16T00:26:51.723834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21702","last_updated":"2026-07-26T00:30:31Z","snapshot_observed_at":"2026-08-14T00:22:08.444752Z","submitted_at":"2025-11-16T14:02:41Z","title":"CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference","version":2},"cited_work":{"arxiv_id":"2511.21702","doi":"10.48550/arxiv.2511.21702","metadata_source":"pith","pith_arxiv_id":"2511.21702","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference","venue":"cs.CL","work_id":"f99fe3b3-20f2-4167-a733-1aa34ddb63c7","year":2025},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.728639Z"},"links":{"cited_paper":"/paper/2511.21702","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:90d31ccde346c158ed58145fcbec597dec50f887a9ff66f62ebb57965d28cec3","observation_id":"ea009249-871f-4384-805e-5d62b270eeba","resolution":{"observed_at":"2026-08-16T00:26:52.046228Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.732590Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.732590Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:a7d4cab0538dc4b914aa8ac388ea70edd4807b0fe860da826dc335e88b963dbb","observation_id":"ffb199e8-2cbe-4df4-ab01-62132dd81eca","resolution":{"observed_at":"2026-08-16T00:26:51.732590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.17187","last_updated":"2026-05-13T16:41:48Z","snapshot_observed_at":"2026-08-06T05:31:02.944877Z","submitted_at":"2026-01-23T21:32:44Z","title":"High-Rate Quantized Matrix Multiplication I","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.17187","snapshot_observed_at":"2026-08-16T00:26:51.736302Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.736302Z"},"links":{"cited_paper":"/paper/2601.17187","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:6bc7949afa50f25ba62843a4957640a633cfc1966a74445d784214fcedb33a3a","observation_id":"80c75c3f-d275-4cc9-955d-c78ea2415877","resolution":{"observed_at":"2026-08-16T00:26:51.736302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22988","last_updated":"2026-06-03T05:56:05Z","snapshot_observed_at":"2026-08-19T13:06:27.404989Z","submitted_at":"2025-05-29T01:53:00Z","title":"Model-Preserving Adaptive Rounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22988","snapshot_observed_at":"2026-08-16T00:26:51.740209Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.740209Z"},"links":{"cited_paper":"/paper/2505.22988","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:e2854fbcb301ece645088de4aa0d9d59a1957dcfc14a33aa4d86879029b22801","observation_id":"f53b61fb-25a5-4b64-8e05-b2918e630807","resolution":{"observed_at":"2026-08-16T00:26:51.740209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.07004","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.990070Z","title":"and Song, Hyun Oh , month = sep, year =","venue":null,"work_id":"bb88e18d-3c12-40a1-bfbb-aa082db11b70","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.744611Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:5b5ca6a491ab258b851aa8b4ee729c85de9a4b4250502e21ffbde5001afa7cb7","observation_id":"da77bd52-72ff-49b5-8878-2eebeaa89c42","resolution":{"observed_at":"2026-08-16T00:26:51.994116Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:53.246922Z","title":"Human behavior and the principle of least effort","venue":null,"work_id":"d0478a14-1e77-4b04-abc3-eccfb87f0e5f","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.748379Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:85371ea9e4ebc4f4779050d16f897127c1d2fb1e67318389c6b79ece7f175049","observation_id":"d4ce992d-b695-48fe-88a0-391f7cc1ca3a","resolution":{"observed_at":"2026-08-16T00:26:53.251815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.751706Z","title":"Psychonomic Bulletin & Review , author =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.751706Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:ffac64e83ff6841f777b65c00c4d6586f5c03094792b9059319a1228319ad094","observation_id":"6ad7c461-1b02-43b8-9624-efe60819ca52","resolution":{"observed_at":"2026-08-16T00:26:51.751706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.05671","last_updated":"2020-06-08T01:28:58Z","snapshot_observed_at":"2026-08-14T22:55:43.974882Z","submitted_at":"2015-03-19T08:30:24Z","title":"Optimizing Neural Networks with Kronecker-factored Approximate Curvature","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.05671","snapshot_observed_at":"2026-08-16T00:26:51.755983Z","title":"Optimizing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.755983Z"},"links":{"cited_paper":"/paper/1503.05671","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:3f5995ed68ece43bca67aecd2229687eff9b8b7302f08645bf56dbd4231bec84","observation_id":"b240474b-dd8a-4af9-b7eb-a28a2a3334d2","resolution":{"observed_at":"2026-08-16T00:26:51.755983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-16T00:26:51.759776Z","title":"doi:10.48550/arXiv.1911.11641 , abstract =","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.759776Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:dfa19647b617c127bcc291887702f93f09d5e43338e3ec4b9a717140a0e84341","observation_id":"3ed13b82-8516-466a-a84b-f993095d7624","resolution":{"observed_at":"2026-08-16T00:26:51.759776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-16T00:26:51.764631Z","title":"doi:10.48550/arXiv.1907.10641 , abstract =","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.764631Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:826efcd4bb247e147450ceb834d32cc4dbd1005cee5b15f1175d3ccf4b16d9a6","observation_id":"adbdb7b3-ce6f-4f39-880d-f56aaf6f7f9b","resolution":{"observed_at":"2026-08-16T00:26:51.764631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18553","last_updated":"2026-05-13T13:18:37Z","snapshot_observed_at":"2026-08-13T15:39:51.316337Z","submitted_at":"2025-07-24T16:22:18Z","title":"The Geometry of LLM Quantization: GPTQ as Babai's Nearest Plane Algorithm","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18553","snapshot_observed_at":"2026-08-16T00:26:51.769211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.769211Z"},"links":{"cited_paper":"/paper/2507.18553","citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:9acf75037488c282f25cfb8b2fd336ae8eed8d1e3337bbd6b8acda244fe71380","observation_id":"50cc1f59-62da-453f-82f3-8a06c8113563","resolution":{"observed_at":"2026-08-16T00:26:51.769211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.11695","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.867002Z","title":null,"venue":null,"work_id":"3c4bc5a8-7457-412a-8b51-0479badbc8e5","year":null},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.773395Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:7eeb4b66407a562c1304bc88aa3a9136f70d675dc268ad38ca7e7b5913d3ec94","observation_id":"8b5471b6-96d2-4dea-8d8d-f04fa5c628a1","resolution":{"observed_at":"2026-08-16T00:26:51.872148Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:26:51.778411Z","title":"Journal of Computational and Applied Mathematics , author =","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:26:51.778411Z"},"links":{"citing_paper":"/paper/2608.12026"},"observation_digest":"sha256:a51d7816a6e96a406f1d0662093918bfae38c4943545bcb71e40428ebdc4f0c3","observation_id":"f3fde395-b9e3-4a47-9e28-ab6125f5474c","resolution":{"observed_at":"2026-08-16T00:26:51.778411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12026","last_updated":"2026-08-12T13:06:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T01:47:20.297286Z","submitted_at":"2026-08-12T13:06:50Z","title":"SoftWater: Class-Aware Rate Allocation for Softmax Quantization"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":54,"verified_exact":10,"verified_fuzzy":1},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.12026."}