{"as_of":"2026-08-10T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:904fe1d1524db2949c98b327fd7178c33f042f5d7c334aaa369b164840d047ea","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:42:23.114204Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18231/citation-record","integrity":"/paper/2505.18231/integrity","json":"/paper/2505.18231/citation-record.json","paper":"/paper/2505.18231"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:42:19.441861Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.441861Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ba101ed074a7ad435efb511ed1a15a02f4d2ff53e21f14659f7c3b95e3c0be74","observation_id":"04021691-f782-4ee0-911a-c5d942775906","resolution":{"observed_at":"2026-08-07T14:42:19.441861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.822105Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms.Advances in Neural Information Processing Systems, 37:100213– 100240, 2025","venue":null,"work_id":"c3fb6428-e5b2-46a0-bfd5-2f37ba9aa439","year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.520380Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:d46716a997f291f6c2b78edc259be0c10dc6d98d9743b8b18847971d67a447d8","observation_id":"c064fde5-75fc-4a2e-b708-2129e03f7fad","resolution":{"observed_at":"2026-08-07T14:42:26.876599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.657201Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"40882291-808d-4320-b80a-951ed439ce52","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.618799Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:bb65880ae25fcb32309c43faf0234e060d6a2c7867e22b9b1a83b67d99595339","observation_id":"d1864e14-059f-4226-8a0c-6a126f8d17bb","resolution":{"observed_at":"2026-08-07T14:42:26.751190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-07T14:42:19.668535Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling.arXiv preprint arXiv:2406.02069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.668535Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:6215b0cc37356363dc359c024f9b375ade447457757c67a6f1507d18f0cf3d4e","observation_id":"88c24244-3562-4128-9757-43225bc40b2e","resolution":{"observed_at":"2026-08-07T14:42:19.668535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.493155Z","title":"Palu: Kv- cache compression with low-rank projection","venue":null,"work_id":"10ff89f1-7673-432c-bc29-752d02e04d5d","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.709613Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:e2a117af1b21dda52cda14a767a38eb6f2dd9e936269d43a969ad44d7955afe8","observation_id":"ba5f5ffe-9949-4414-a9f7-cecf98a97fd4","resolution":{"observed_at":"2026-08-07T14:42:26.582959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:19.764346Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.764346Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:2315d15c81b983fbadfffc3d4878d7ea1c3bd509f17d1a7a1cbab8426dcc910d","observation_id":"91388cae-ec1a-4f50-b9c5-1d2c76dc15a4","resolution":{"observed_at":"2026-08-07T14:42:19.764346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05265","last_updated":"2025-01-27T13:39:25Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:59:35Z","title":"PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05265","snapshot_observed_at":"2026-08-07T14:42:19.813220Z","title":"Prefixquant: Static quantization beats dynamic through prefixed outliers in llms.arXiv preprint arXiv:2410.05265, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.813220Z"},"links":{"cited_paper":"/paper/2410.05265","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:4260e17ef22534894adcbcdebffa8aa3fd8bde90d55d0f9ec6d449399e7876ed","observation_id":"be3bddb7-379b-45c4-ad85-3dab61ece3b6","resolution":{"observed_at":"2026-08-07T14:42:19.813220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:42:19.966304Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:19.966304Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:fcc969f74d53ffda654983b08ed89afcfa2a7ede9322583dc7460dfd07c10408","observation_id":"589311a8-858a-4cf4-86fd-0d9430dc88b7","resolution":{"observed_at":"2026-08-07T14:42:19.966304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02065","last_updated":"2021-10-03T07:43:16Z","snapshot_observed_at":"2026-08-08T12:56:25.525166Z","submitted_at":"2021-10-03T07:43:16Z","title":"SDR: Efficient Neural Re-ranking using Succinct Document Representation","version":1},"cited_work":{"arxiv_id":"2110.02065","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02065","snapshot_observed_at":"2026-08-07T14:42:23.728088Z","title":"SDR: Efficient Neural Re-ranking using Succinct Document Representation","venue":"cs.IR","work_id":"5e77f4cb-7f39-4132-b79f-6d9de69cea97","year":2021},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.113131Z"},"links":{"cited_paper":"/paper/2110.02065","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:80eab81e86365408b7b57f6823c6cc90afddcdd52e15905191529a3029a3b54d","observation_id":"523759e0-e41f-47d2-b35d-306f8731b9da","resolution":{"observed_at":"2026-08-07T14:42:23.794083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-07T14:42:20.170685Z","title":"Qlora: Efficient finetuning of quantized llms, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.170685Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:5e810c94fc3f87d9d19943c9b552efea82247c6fd11cc4b0ce0a46ea48ebb77a","observation_id":"e6527f5f-df86-49c4-b3d3-88fdb0cc812f","resolution":{"observed_at":"2026-08-07T14:42:20.170685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-06T11:31:16.355778Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-07T14:42:20.242101Z","title":"Extreme compression of large language models via additive quantization.arXiv preprint arXiv:2401.06118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.242101Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b91218ff3721f73d225fc9921cecf96e425b3e27911c0712a31502cf7295b3c5","observation_id":"daa42476-cae2-4cc7-a772-afad805be48b","resolution":{"observed_at":"2026-08-07T14:42:20.242101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T14:42:20.321754Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers.arXiv preprint arXiv:2210.17323, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.321754Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:6f1a85db8a618d8a3d1a2227bf444bbaa3d90f20e938d9a543c7908fbbf0ca3a","observation_id":"20dde1d7-2727-4da2-8f76-345abae103fd","resolution":{"observed_at":"2026-08-07T14:42:20.321754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.317678Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":"3fc6cdfc-2828-4610-b554-7598d752cb2a","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.403085Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:f6210cdf6bf00c59916abfc858bbeda88e3cf54a95e44d9fef8ffcaebd40f87e","observation_id":"7b40e5c0-9aa5-4cf1-b909-8b9a77f3007a","resolution":{"observed_at":"2026-08-07T14:42:26.414042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:42:20.499175Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.499175Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ece82c6e386eae8c7aafb08b2c3f4bca30511b85405b95277648287c79643c45","observation_id":"3b8af31b-88bf-48d7-8a27-2733d47331b5","resolution":{"observed_at":"2026-08-07T14:42:20.499175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:42:20.623145Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.623145Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:17be974721428b57ece8fcef383b7dd1ff8371178114f30f0332ce61a650d015","observation_id":"0e792160-6fcd-460f-ab99-611bae593cf0","resolution":{"observed_at":"2026-08-07T14:42:20.623145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:20.725384Z","title":"Finding structure with randomness: Probabilistic algorithms for constructing approximate matrix decompositions.SIAM review, 53(2):217–288, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.725384Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:f50ec5aa4d93b1269c1ea127545cde04754080932eb1677ec63990f044444ba6","observation_id":"96eb77fc-124f-4476-92df-21cf9a40f843","resolution":{"observed_at":"2026-08-07T14:42:20.725384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-07T14:42:20.783045Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification.arXiv preprint arXiv:2405.14256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.783045Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:92a2e83befcae1dd394f64c35ebd2cc5c65c9a22e505671258fec9b23bcc8e4e","observation_id":"735a74b6-9c5a-4958-af5b-36956bc96a53","resolution":{"observed_at":"2026-08-07T14:42:20.783045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T14:42:20.854098Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.854098Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b5f6e920048400ccd371c1e0e46139d5d46d9669c9b9ee0a8643058c2fdd415f","observation_id":"4a3d52a4-87ed-4ce3-9d03-863457c7e3e0","resolution":{"observed_at":"2026-08-07T14:42:20.854098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:20.904104Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.904104Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:2b23dc64ff8fabfdca3b5920621472227b12fe85e49cf73e461ed1187f966680","observation_id":"5ca32f2e-10e1-42c3-a799-bdc70c0a2837","resolution":{"observed_at":"2026-08-07T14:42:20.904104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13987","last_updated":"2025-01-23T08:24:25Z","snapshot_observed_at":"2026-08-10T01:23:08.972359Z","submitted_at":"2025-01-23T08:24:25Z","title":"OstQuant: Refining Large Language Model Quantization with Orthogonal and Scaling Transformations for Better Distribution Fitting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13987","snapshot_observed_at":"2026-08-07T14:42:20.965959Z","title":"Ostquant: Refining large language model quantization with orthogonal and scaling transformations for better distribution fitting.arXiv preprint arXiv:2501.13987, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:20.965959Z"},"links":{"cited_paper":"/paper/2501.13987","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:07edc0a2420f6116c512c73a5bf6371fed3ace46373fc69af05ce067e9c346f2","observation_id":"67e9cea5-60b0-4f83-a1c7-19a6a6315861","resolution":{"observed_at":"2026-08-07T14:42:20.965959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.019251Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.019251Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:9d3467c42a4dda6c44df02d495443607ec7893fb47492be822b178311732fee2","observation_id":"0ffa03f2-aeb4-406d-82c3-eb69fd9ac9d4","resolution":{"observed_at":"2026-08-07T14:42:21.019251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T14:42:21.069575Z","title":"Squeezellm: Dense-and-sparse quantization.arXiv preprint arXiv:2306.07629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.069575Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:fdb79f00744633ad514cf33a820f6c56436f3247d8e2f67f08c903a8798e6502","observation_id":"c33b91b4-7076-4fed-839a-2d4ea3d92494","resolution":{"observed_at":"2026-08-07T14:42:21.069575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.150721Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.150721Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:36c49ae86b07683323add3fd5edb39ff6224c58515bdd0b8db6cd5877bbc084e","observation_id":"510a1e5d-fb85-4824-9e6c-b785a122dce8","resolution":{"observed_at":"2026-08-07T14:42:21.150721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.194134Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks.Advances in neural information processing systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.194134Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b9a2c91be3b9a8bef3b0d54e1cfa7701d66726d1aa80bcc80c1e3d70af9ead84","observation_id":"93600400-dce6-4a09-8da9-685a63ff55d3","resolution":{"observed_at":"2026-08-07T14:42:21.194134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.275247Z","title":"Snapkv: Llm knows what you are looking for before generation.Advances in Neural Information Processing Systems, 37:22947–22970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.275247Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:1d02419266521e913300ced55c0c0536ddf24d33cdc3afee295f7ad920b8c910","observation_id":"1d7e3402-796f-45cc-8aba-8a6650c27255","resolution":{"observed_at":"2026-08-07T14:42:21.275247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-08-09T17:23:31.194174Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-07T14:42:21.377519Z","title":"Matryoshkakv: Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.377519Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:f74d8f2333f2f2a538ebcabb72904a9dd516ccf5f0edcfa5c8171632cbccb1c7","observation_id":"e30a4de3-986a-4d57-bf11-6c0d9001326c","resolution":{"observed_at":"2026-08-07T14:42:21.377519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:26.097670Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":"da04d2bc-fa58-4d9b-90c4-f52ea24cb5ea","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.476258Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ed7ca4ccfe973f2004e458e3f3538d29e881f930d2fd2b7fa2d1b5e21d542bf3","observation_id":"7ff29666-6aef-41c8-840f-82f242a95a2f","resolution":{"observed_at":"2026-08-07T14:42:26.198825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17066","last_updated":"2024-10-22T11:47:04Z","snapshot_observed_at":"2026-08-06T23:02:55.718749Z","submitted_at":"2024-09-25T16:25:45Z","title":"VPTQ: Extreme Low-bit Vector Post-Training Quantization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17066","snapshot_observed_at":"2026-08-07T14:42:21.528632Z","title":"Vptq: Extreme low-bit vector post-training quantization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.528632Z"},"links":{"cited_paper":"/paper/2409.17066","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:0690dfb43055e7123f14711fb10b406a17eb6b8e988136c9717a9369daa305f3","observation_id":"0c0a7fbb-d6e8-41a6-9cc4-bf018e610764","resolution":{"observed_at":"2026-08-07T14:42:21.528632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-07T14:42:21.563050Z","title":"Spinquant: Llm quantization with learned rotations.arXiv preprint arXiv:2405.16406, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.563050Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:a382a8ca0f9fdd5e20a244ab0ccca51f9d37aa13752e77d4fc34938200a455b3","observation_id":"0d3692ca-f0bf-41ec-ae6a-a95c3ae19497","resolution":{"observed_at":"2026-08-07T14:42:21.563050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T14:42:21.631333Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.631333Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:c19083fa6995b666858ddc9d491ddfdae8365b45045216016802e0624b0f6a74","observation_id":"86282d67-e22d-4b85-a153-824487fbbdd5","resolution":{"observed_at":"2026-08-07T14:42:21.631333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.879925Z","title":null,"venue":null,"work_id":"588b2deb-362d-411b-97cc-e029f6d8fee1","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.706702Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b6442795eb60ec50fd6766e68243f680647c2589eec8ed2b1eebf74fd8330581","observation_id":"ef42813c-e02f-4efe-a7e1-e6948ece603f","resolution":{"observed_at":"2026-08-07T14:42:25.985348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.756963Z","title":"Cake: Cascading and adaptive kv cache eviction with layer preferences.arXiv preprint arXiv:2503.12491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.756963Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:a7cc2a1d43960e114f6bf75140be72ecaa63acd1f6e68e083e2a767ce21941f5","observation_id":"8a2d3072-513e-4c5a-8db2-9ed89116cbc4","resolution":{"observed_at":"2026-08-07T14:42:21.756963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:21.846993Z","title":"Coqa: A conversational question answering challenge.Transactions of the Association for Computational Linguistics, 7:249–266, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.846993Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:208939e38d589974f45abaff2d4e905895223ff7bf7ff2958e02a99488cb46e3","observation_id":"4c80056c-736e-482b-884d-e635ae7bda2a","resolution":{"observed_at":"2026-08-07T14:42:21.846993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.678879Z","title":"Hanson-wright inequality and sub-gaussian concentra- tion","venue":null,"work_id":"3df52cf0-ea5a-4a6a-9a42-35695d411ea0","year":2013},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:21.943014Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:1ea293b9ce65e9d88160291a37ebba53ada1e9d9f411cbd63ce6a4dcae06546e","observation_id":"93d8bf7c-4959-4bc8-8d67-58a6147bd157","resolution":{"observed_at":"2026-08-07T14:42:25.738176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.516271Z","title":null,"venue":null,"work_id":"45a489d3-64eb-4a45-83ea-3551de21f9d0","year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.054272Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:ba8bc2c903e339f8313649444077fc5078836dd0a24d51523e2037fbfb4bc420","observation_id":"8a99de4a-d23d-4050-850c-d43e52fedb8c","resolution":{"observed_at":"2026-08-07T14:42:25.616849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:42:22.125724Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.125724Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:bb74d839bf60f219ba50bb64f39310217a7a78c47c763319b1d0973c5258e080","observation_id":"9e15ebc8-9549-4bb6-a683-c712d4cb7235","resolution":{"observed_at":"2026-08-07T14:42:22.125724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.343227Z","title":"QuIP#: Even better LLM quantization with hadamard incoherence and lattice codebooks","venue":null,"work_id":"1833ce6d-3cba-4d83-984d-ddd57644eccd","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.217465Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:0a1c9c22c1d5e19ab4d025955f205f06935a084de84592884835cfd2bfd40c5e","observation_id":"b0a527a4-b230-468f-bd55-1992104ff61b","resolution":{"observed_at":"2026-08-07T14:42:25.408508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:22.302830Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.302830Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:54ab822b4e0496757ce4d432a24ec78df29a9ded594cdadad5446c33e6391e92","observation_id":"07b96d21-7971-43bc-ac17-0773479f1a63","resolution":{"observed_at":"2026-08-07T14:42:22.302830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18415","last_updated":"2025-06-13T05:55:26Z","snapshot_observed_at":"2026-08-07T15:59:11.064826Z","submitted_at":"2025-04-25T15:17:52Z","title":"BitNet v2: Native 4-bit Activations with Hadamard Transformation for 1-bit LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18415","snapshot_observed_at":"2026-08-07T14:42:22.378319Z","title":"Bitnet v2: Native 4-bit activations with hadamard transformation for 1-bit llms.arXiv preprint arXiv:2504.18415, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.378319Z"},"links":{"cited_paper":"/paper/2504.18415","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:6779ba52bfc425c5e5c681bf801252e3d0d263c100341d42b33d31524cc83da0","observation_id":"50e1376b-fe23-4b48-b5f8-6a7a9f9b03e5","resolution":{"observed_at":"2026-08-07T14:42:22.378319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:22.452938Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.452938Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:55829e01e9beab3582ed4587ecca52cdca75ddf41a11914375b3991a5d42cc67","observation_id":"487e206a-3751-47e3-9ec8-a14135340265","resolution":{"observed_at":"2026-08-07T14:42:22.452938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-07-06T17:36:40.933805Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-07T14:42:22.512307Z","title":"No token left behind: Reliable kv cache compression via importance-aware mixed precision quantization.arXiv preprint arXiv:2402.18096, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.512307Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:0dbb7b640f9b3a5566494fbc33f9d115c8df52d81be3991252bb07518720f431","observation_id":"d96754ce-5019-4912-aa00-8454d5ad2387","resolution":{"observed_at":"2026-08-07T14:42:22.512307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13003","last_updated":"2023-03-23T02:55:50Z","snapshot_observed_at":"2026-07-06T15:06:56.845060Z","submitted_at":"2023-03-23T02:55:50Z","title":"Benchmarking the Reliability of Post-training Quantization: a Particular Focus on Worst-case Performance","version":1},"cited_work":{"arxiv_id":"2303.13003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.13003","snapshot_observed_at":"2026-08-07T14:42:23.396409Z","title":"Benchmarking the Reliability of Post-training Quantization: a Particular Focus on Worst-case Performance","venue":"cs.LG","work_id":"3a318a4d-91b9-44b3-b9af-feb2a4545947","year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.560543Z"},"links":{"cited_paper":"/paper/2303.13003","citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:66bad5ab61e9920737deb5a9df15a41277d181a650ed87ae72dc0ee5922df78e","observation_id":"87d1acc8-019d-4a99-bedb-7d94516415f0","resolution":{"observed_at":"2026-08-07T14:42:23.446611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:25.160925Z","title":"Kv cache is 1 bit per channel: Efficient large language model inference with coupled quantization.Advances in Neural Information Processing Systems, 37:3304–3331, 2024","venue":null,"work_id":"45f0b839-fc47-450d-889f-e9cd3bdf6a27","year":2024},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.657980Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:e70252ce439e853d8684d89a7ed736983ac220f7dfbb4fefab965c9b077a7ebb","observation_id":"96f64d5c-4832-4640-93ca-2772e53b30f5","resolution":{"observed_at":"2026-08-07T14:42:25.245202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.934751Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":"c6cd3b05-313f-4ef7-88ac-bb581d3f2e46","year":2023},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.696914Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b6561da0bc6e9c46e04e008c59ef03290767ea7c9322047d282d5dd23bfd9255","observation_id":"b3f8a2f2-0842-4cc6-93e4-361c804c15e6","resolution":{"observed_at":"2026-08-07T14:42:25.047251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.747742Z","title":"Decompose Σ = Cov(X) =D+A , D= diag(Σ),A ii = 0,∥A∥ F ≤Γ","venue":null,"work_id":"b3ec0068-d2f4-4e28-9861-79ad1722ec80","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.744073Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:c66c1f49f895dab2312590903a324ad586661f6eff9e3303dfa28254baeb102e","observation_id":"4c769c61-a318-4598-9404-46aaa563c585","resolution":{"observed_at":"2026-08-07T14:42:24.860495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.570632Z","title":null,"venue":null,"work_id":"ec07038b-edc3-460d-be10-79394883fbaf","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.835376Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:28c4ca98f5e21da93d3aca68b05d28d0ecd322367d7eaa970a274a62a7f30b40","observation_id":"005a9e7c-b858-409e-88b6-4d08833ba59f","resolution":{"observed_at":"2026-08-07T14:42:24.627060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.407432Z","title":"Then hTDh= 1−¯ε, f(h) :=h TAh= 1 d sTAs, and Var(Yi) = (1−¯ε) +f(h)","venue":null,"work_id":"7be47945-53ad-4a98-afd6-f0f96a4dafb9","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.891916Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b166b3a0c0f6fc80555bb0041640814fd47581e715ab655f8d1f1b805dc9805e","observation_id":"9ae2d4ba-a8d4-4bcd-a9df-c8af1065cd99","resolution":{"observed_at":"2026-08-07T14:42:24.481106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:24.203450Z","title":"Applying the Hanson-Wright inequality [34], for anyu >0 Pr |sTAs|> u ≤2 exp −c u2/Γ2 wherecis a universal constant","venue":null,"work_id":"2d57c1c5-83fe-438e-8ae6-0ae314c4595a","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:22.978513Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:c22a7dbf93780291ebd25d019f1472dd78155d218dc1704dd74e1cd62500ebcc","observation_id":"3ff43d2c-dac1-43d0-9560-f3cb61434e5a","resolution":{"observed_at":"2026-08-07T14:42:24.295084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:23.904206Z","title":"Exponent becomes −ln(2/α) ; hence Pr(|f(h)|> t)≤α","venue":null,"work_id":"e2df00fc-3809-4b8a-967e-e590a42329b2","year":null},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:23.036088Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:795490f60dd90f28bb84af18ebea370bcd1cefa1b9e4af678728e82e548be412","observation_id":"94c89684-f3fd-4a5a-9186-136648659cb3","resolution":{"observed_at":"2026-08-07T14:42:24.086439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2856.8562","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:23.291219Z","title":null,"venue":null,"work_id":"8955fcf0-b4e1-43c4-b382-d75e21b01a73","year":1957},"citing_paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:23.114204Z"},"links":{"citing_paper":"/paper/2505.18231"},"observation_digest":"sha256:b64352cd1c2f146b63034a9c6509fe6f25bca8e73a9d454b90e980be1b25c1bd","observation_id":"9145d042-9aea-4cae-9d61-0018c71de493","resolution":{"observed_at":"2026-08-07T14:42:23.342602Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18231","last_updated":"2026-07-15T15:32:56Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:25:40.013565Z","submitted_at":"2025-05-23T12:40:07Z","title":"NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.18231."}