{"as_of":"2026-08-16T19:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5e95147f782f6de27e5989ff87e846a3c7f51ac8c2ca484e3adedbf3354dd6b5","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:22:39.003914Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:38:48.606027Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:59:52.356456Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-11T00:38:48.606027Z","title":"Resq: Mixed- precision quantization of large language models with low-rank residuals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:48.606027Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:198ec278e6d2d1c25a9972f58892abc7dbf1522e664d29ab93b0151fb2b40534","observation_id":"0989df39-3651-4f1f-b73d-8a0fd835d447","resolution":{"observed_at":"2026-08-11T00:38:48.606027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-10T14:54:22.698198Z","title":"Resq: Mixed-precision quantization of large language models with low-rank residuals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-15T12:01:34.913489Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T14:54:22.698198Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2501.16383"},"observation_digest":"sha256:749297c0f6438810a1c093e0e55b6ac14b8db45c85af4e05e73d7414a1c2e4fd","observation_id":"9354d518-b538-432f-b321-777feba70eff","resolution":{"observed_at":"2026-08-10T14:54:22.698198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-03T11:10:52.707779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07475","last_updated":"2026-07-04T06:36:53Z","snapshot_observed_at":"2026-08-15T13:14:22.329443Z","submitted_at":"2026-01-12T12:27:22Z","title":"ARCQuant: Boosting NVFP4 Quantization with Augmented Residual Channels for LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T11:10:52.707779Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2601.07475"},"observation_digest":"sha256:e24ac68eca1b72fbbf0c236963c70a6fc98f2854fa676303c5522a8c66466436","observation_id":"db04ed1b-9a1f-47cd-889a-6f9c31fb8190","resolution":{"observed_at":"2026-08-03T11:10:52.707779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2604.20682","last_updated":"2026-04-22T15:31:46Z","snapshot_observed_at":"2026-08-15T13:47:52.484402Z","submitted_at":"2026-04-22T15:31:46Z","title":"Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:44:42.989053Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2604.20682"},"observation_digest":"sha256:f59ce0673928b02ceacdb38cda7e796dcd8f58e534980259619febfa24d8b34e","observation_id":"203c50dc-9625-4f66-a193-588f56647cd9","resolution":{"observed_at":"2026-05-11T13:26:04.544270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2606.04115","last_updated":"2026-07-14T14:04:32Z","snapshot_observed_at":"2026-08-02T05:34:23.902031Z","submitted_at":"2026-06-02T18:23:20Z","title":"dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T11:20:06.292977Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.04115"},"observation_digest":"sha256:7ffeb704f63133efe2287f618a867495a5d054d4110ffd072a58281110648f08","observation_id":"2fa022f9-b499-44ef-8a7c-376882dc0c21","resolution":{"observed_at":"2026-07-02T02:06:26.105639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-15T10:56:54.155632Z","title":"ResQ: Mixed-precision quan- tization of large language models with low-rank residuals.arXiv preprint arXiv:2412.14363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04115","last_updated":"2026-07-14T14:04:32Z","snapshot_observed_at":"2026-08-02T05:34:23.902031Z","submitted_at":"2026-06-02T18:23:20Z","title":"dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-15T10:56:54.155632Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.04115"},"observation_digest":"sha256:ea078d6d435009f8c2900a52017474b472aff0ba21a68612179e4e53d23740fc","observation_id":"74e42f0f-80a9-4853-899d-dc176c6a364d","resolution":{"observed_at":"2026-07-15T10:56:54.155632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2606.12876","last_updated":"2026-06-11T04:06:02Z","snapshot_observed_at":"2026-08-14T07:53:14.651205Z","submitted_at":"2026-06-11T04:06:02Z","title":"Multi-Bitwidth Quantization for LLMs Using Additive Codebooks","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-27T07:29:14.923431Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.12876"},"observation_digest":"sha256:f6a6fa5be5bde01086dcad3c7be4f24cc1f51edd0b47564329dd6f4aacd44860","observation_id":"76203019-c512-4b06-928c-48c9af433a7d","resolution":{"observed_at":"2026-07-03T13:48:21.307051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":"2412.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-07-04T12:59:52.356456Z","title":"Mixed-Precision Quantization of Large Language Models","venue":null,"work_id":"9970dc39-d908-43e1-846b-0b18a85ac0ab","year":2025},"citing_paper":{"arxiv_id":"2606.26587","last_updated":"2026-06-25T04:19:04Z","snapshot_observed_at":"2026-08-02T10:04:20.542320Z","submitted_at":"2026-06-25T04:19:04Z","title":"SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T05:41:39.052865Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2606.26587"},"observation_digest":"sha256:9be3bfd6cd0e5319f828b61e6dcbf5291677a8b85962dfa2bb9892b891748be0","observation_id":"0c189f19-d0d7-4bf7-96ca-0de477a6d0e3","resolution":{"observed_at":"2026-07-04T12:59:52.357889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14363","snapshot_observed_at":"2026-08-01T03:16:46.892829Z","title":"Resq: Mixed-precision quantization of large language models with low-rank residuals,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27694","last_updated":"2026-07-30T05:26:20Z","snapshot_observed_at":"2026-08-16T00:23:09.347215Z","submitted_at":"2026-07-30T05:26:20Z","title":"GyRot: Leveraging Hidden Synergy between Rotation and Fine-grained Group Quantization for Low-bit LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:16:46.892829Z"},"links":{"cited_paper":"/paper/2412.14363","citing_paper":"/paper/2607.27694"},"observation_digest":"sha256:86e0eae3479da47b1aa392db361b844f9f7d3ece82a855e8250db6313785b39b","observation_id":"040d99fe-e452-4a6e-8205-a5dc4e315599","resolution":{"observed_at":"2026-08-01T03:16:46.892829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14363/citation-record","integrity":"/paper/2412.14363/integrity","json":"/paper/2412.14363/citation-record.json","paper":"/paper/2412.14363"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-16T14:24:10.346445Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-11T12:22:38.755084Z","title":"L., Nascimento, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.755084Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:8a7550fbe55a046e14fedf2b97e6a98fc50ce7fa9c0128231695d13e88dc1ff2","observation_id":"fda058dc-91e5-4449-8546-40e713c32df8","resolution":{"observed_at":"2026-08-11T12:22:38.755084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.760201Z","title":"QUIK : Towards end-to-end 4-bit inference on generative large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.760201Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:30f65eea85fb70100fad432c2fd375c82b5c14672b0d9ee3f7a184ec04c5e4c6","observation_id":"98d6d846-a6bf-4649-8968-14bffd0b998c","resolution":{"observed_at":"2026-08-11T12:22:38.760201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-16T14:04:57.666315Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-11T12:22:38.763953Z","title":"L., Li, B., Cameron, P., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.763953Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:54639695063404b069a60da3df49f6a0eb2189ebe099fdb7959ccd3a71706608","observation_id":"29ebbb2a-601c-4599-8f5c-79cef0d22026","resolution":{"observed_at":"2026-08-11T12:22:38.763953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.768700Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.768700Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:a3b04dcf0522ab727ec575808d80f15fe23da8f8af3328dddb5d493b5cc6d1c1","observation_id":"0cf70a50-b769-449d-a644-eacf1bbe934c","resolution":{"observed_at":"2026-08-11T12:22:38.768700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.906342Z","title":"PIQA : Reasoning about physical commonsense in natural language","venue":null,"work_id":"530325d7-eb12-4b5b-8096-308a895706b4","year":2020},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.772381Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:368c71b73eaf6c45b21a644313369e357100015470002775821a0f5c6f6a5565","observation_id":"4906daad-b726-4035-baa8-4ed936460af0","resolution":{"observed_at":"2026-08-11T12:22:39.910642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-11T12:22:38.776013Z","title":"S., and Wu, K.-C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.776013Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:820390d9b1e03767dccdafcd4cd6c65e3634ec1467a9ce646c11a98418ceed80","observation_id":"323c0ab9-4f1b-4b74-ad4e-9bb33b0d543a","resolution":{"observed_at":"2026-08-11T12:22:38.776013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.895197Z","title":null,"venue":null,"work_id":"e3bec6ed-3741-4626-a4bd-e5815d262af3","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.780084Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:60e1d19aa63ef6aaad26515a84e2e5c75d81f119197ee6c87a0a2220b30b5e83","observation_id":"73f4de28-cf69-4dbd-9b85-e5de4284169e","resolution":{"observed_at":"2026-08-11T12:22:39.899036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.06085","last_updated":"2018-07-17T07:33:19Z","snapshot_observed_at":"2026-08-14T19:14:52.069991Z","submitted_at":"2018-05-16T01:19:43Z","title":"PACT: Parameterized Clipping Activation for Quantized Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.06085","snapshot_observed_at":"2026-08-11T12:22:38.783535Z","title":"I.-J., Srinivasan, V., and Gopalakrishnan, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.783535Z"},"links":{"cited_paper":"/paper/1805.06085","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:8e34cfa04d2750ed56c545301e2d89d571e370b5cce893143652501b8b8d84b1","observation_id":"ea7bf735-f1ff-4498-b177-db544f4e548b","resolution":{"observed_at":"2026-08-11T12:22:38.783535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-11T12:22:38.787784Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.787784Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:058d7c5336d7bead03acf174f3be9081e28d12162556d0165ce4f1db86c53b55","observation_id":"b5a31317-a4a4-42c1-a1c2-c64253763a13","resolution":{"observed_at":"2026-08-11T12:22:38.787784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T12:22:38.792466Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.792466Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:7d11a1be5c7d3fc577226d6c0d498015860bce3ac4dce617884cb4882b70578a","observation_id":"888b947e-c520-44d0-b28f-42183e4f8769","resolution":{"observed_at":"2026-08-11T12:22:38.792466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T12:22:38.796468Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.796468Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0e9ca952b05247ab60a6dbd1ecdda78800e11e0f2cb6378722107ede8bc2d838","observation_id":"ca9a8a28-4d9b-4d4c-9079-ec3c659ea1e0","resolution":{"observed_at":"2026-08-11T12:22:38.796468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.800077Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.800077Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:e49c33da289ea6a07bcc656d15db14d865dc323fbcaf85f256133d7fa1bdcd0b","observation_id":"9735236a-e432-4f9c-a318-640e13cfae42","resolution":{"observed_at":"2026-08-11T12:22:38.800077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-16T15:26:27.063395Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-11T12:22:38.803446Z","title":"SpQR : A sparse-quantized representation for near-lossless llm weight compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.803446Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:3221dc4a2bca3d3e2f5db5d5751255d96987510149798a9af537b33101be1130","observation_id":"fa5ce59d-3650-4b85-9f2b-1675639fee9f","resolution":{"observed_at":"2026-08-11T12:22:38.803446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-16T14:11:54.298010Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-11T12:22:38.806973Z","title":"QAQ : Quality adaptive quantization for llm kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.806973Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:afb31328c8ba746ebbc7107d5ce004699962ca17c8d833dd45b3ceaabc11748f","observation_id":"bd55bf82-363b-46c6-ba82-1cd0ece397af","resolution":{"observed_at":"2026-08-11T12:22:38.806973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-16T14:28:07.514724Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-11T12:22:38.810656Z","title":"Extreme compression of large language models via additive quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.810656Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:8a4c4d741322c72f24cc3248d74c1b7c119be839bc48a1fe9412eea4cdb03817","observation_id":"012ecf26-b6d9-431e-96fb-17a1f35b1b75","resolution":{"observed_at":"2026-08-11T12:22:38.810656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-11T12:22:38.814251Z","title":"GPTQ : Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.814251Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0110cb5e3c5149dba7682e1967fd38b5175f484c50c1e04b38563292fd5e7d09","observation_id":"0300c697-a7cb-4e93-808d-7971eda845a7","resolution":{"observed_at":"2026-08-11T12:22:38.814251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.817747Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.817747Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:47cc3888c99254129ef80d71ce153d40709cba33729e4a846d87e6ee1240441a","observation_id":"9320ed35-7913-479d-8256-8bc779be1619","resolution":{"observed_at":"2026-08-11T12:22:38.817747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.821257Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.821257Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:e1b911d16e51f1ae4deb2b8a76d24c9cbc1300a03cdb1b29b339a9d26bb44487","observation_id":"98a1aaa1-5cee-4e4c-b7d6-b28d76ef90f9","resolution":{"observed_at":"2026-08-11T12:22:38.821257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-15T08:38:48.386530Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-08-11T12:22:38.824457Z","title":"SAMSum corpus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.824457Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:75f95a765cf19c1dc87e7be9df08cea357442987513f8fc2a9742ef40bcdb04f","observation_id":"a187354c-1988-4510-bcea-69d363d219c8","resolution":{"observed_at":"2026-08-11T12:22:38.824457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.870995Z","title":"APTQ : Attention-aware post-training mixed-precision quantization for large language models","venue":null,"work_id":"6a23c262-b502-4ba4-94a3-f4355b46b921","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.828156Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:cd7d6d36a64edf1a7355046c70ff811f0205108e8d639b72904a1128c50a8d3e","observation_id":"b491a92e-362b-4c19-8fb1-d7eee7902bd1","resolution":{"observed_at":"2026-08-11T12:22:39.874845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-08-16T13:50:20.836322Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-11T12:22:38.831351Z","title":"ZipCache : Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.831351Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:1362dd2fc498f3a3762ebd6382c7bd59fa380aeeb319621c8922a48baaf0d7a3","observation_id":"eb1cb692-bfda-4467-89e1-2f8988c49a39","resolution":{"observed_at":"2026-08-11T12:22:38.831351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.835297Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.835297Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f9fc9029727f6575ed7dd07f6c53aceb1f8623f6989d2df40568fc095cfd2bc7","observation_id":"85af2621-dfc3-414b-8eb8-47ee1a297c0f","resolution":{"observed_at":"2026-08-11T12:22:38.835297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-16T14:22:45.622061Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T12:22:38.838579Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.838579Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:557b128e2c5c4d938becff68c36309313b2cd5ff20f0c581c2e339c21aba885b","observation_id":"6aab0856-dddc-441b-bce0-76553e2988e1","resolution":{"observed_at":"2026-08-11T12:22:38.838579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14917","last_updated":"2025-05-25T08:58:37Z","snapshot_observed_at":"2026-08-16T17:18:53.719666Z","submitted_at":"2024-05-23T16:21:48Z","title":"SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14917","snapshot_observed_at":"2026-08-11T12:22:38.842294Z","title":"SliM-LLM : Salience-driven mixed-precision quantization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.842294Z"},"links":{"cited_paper":"/paper/2405.14917","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:608071fe38702d249082c6d0530b8b3be4c45f3e2b10af918250c0a844c3bd8b","observation_id":"94e41327-fd94-452c-9613-0033d004c734","resolution":{"observed_at":"2026-08-11T12:22:38.842294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.852688Z","title":"Accurate post training quantization with small calibration sets","venue":null,"work_id":"2972e806-d749-47dd-9e24-cdfb1fe2eba7","year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.845886Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:c000ca14be911539e5037c4a2088d8487ff6298436cc61661eaf3ee7d9a03419","observation_id":"180cdfcd-5a4f-449d-9476-ff9ccfa7946b","resolution":{"observed_at":"2026-08-11T12:22:39.856640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-16T14:11:31.440997Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T12:22:38.849655Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.849655Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:c6ce3f7b7b5b2fe566e89d8b1c4ae41b00461fac716f18b0b73e70b50b456ee4","observation_id":"8a50b5f7-d468-4e8b-bfbc-e2ed5fb7edd7","resolution":{"observed_at":"2026-08-11T12:22:38.849655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-16T15:24:21.726803Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-11T12:22:38.853192Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.853192Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:68e02f1a6002f1a6c9e560da76f30186e1ff06946c9b06bd6e9c2bd29d7b31d7","observation_id":"5194d093-8a59-44b6-8c34-a4f59fa04511","resolution":{"observed_at":"2026-08-11T12:22:38.853192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.841327Z","title":"OWQ : Outlier-aware weight quantization for efficient fine-tuning and inference of large language models","venue":null,"work_id":"fa120812-ec81-42db-a576-181062982ad1","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.856813Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:073f7bf0c0d1695afb26e0958279dae92d408d1458fa9831e7243c43de237729","observation_id":"01e71233-e6d8-40b0-8ba8-b8bf66f08fbf","resolution":{"observed_at":"2026-08-11T12:22:39.845115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.860219Z","title":"SVDQuant : Absorbing outliers by low-rank components for 4-bit diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.860219Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:eecda3633fa8e2893b2a8f2f8a20c908626ff15beeba59044e0c07e1769587f7","observation_id":"3670b04e-1dd8-4b6e-adfc-e19f7341568e","resolution":{"observed_at":"2026-08-11T12:22:38.860219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14731","last_updated":"2025-05-16T09:40:01Z","snapshot_observed_at":"2026-08-16T13:08:53.566354Z","submitted_at":"2024-10-16T08:34:51Z","title":"MatryoshkaKV: Adaptive KV Compression via Trainable Orthogonal Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14731","snapshot_observed_at":"2026-08-11T12:22:38.863760Z","title":"MatryoshkaKV : Adaptive kv compression via trainable orthogonal projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.863760Z"},"links":{"cited_paper":"/paper/2410.14731","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ec0254d7f49cfb572901186da9a80e5b12442991132b0e6167e2dbec24efcada","observation_id":"b295b582-d3bf-47e4-b5c9-8ef67398a795","resolution":{"observed_at":"2026-08-11T12:22:38.863760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.830606Z","title":"Duquant: Distributing outliers via dual transformation makes stronger quantized llms","venue":null,"work_id":"36ce9ac1-1c2a-4feb-9107-0407771e0b56","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.867491Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:bddb0d51021f8b1cc2072a3df86acd6e6b5f453fb14710aa7207e775d5d9215d","observation_id":"8518c039-3763-4a23-8a5d-9a0328f83243","resolution":{"observed_at":"2026-08-11T12:22:39.834633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.820086Z","title":"AWQ : Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"51c30594-288d-492c-90ba-01af4f0ad1bb","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.870930Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:173de4c0a23922d653f6052aafb1ade3714379a163e21a8309e37eb9c9f7dc20","observation_id":"f5882700-fdd5-418b-bdd4-ddb5ba719e1e","resolution":{"observed_at":"2026-08-11T12:22:39.823746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-16T13:54:34.341970Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-11T12:22:38.874322Z","title":"QServe : W4a8kv4 quantization and system co-design for efficient llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.874322Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:56882665feee1973b931685cd2996d306b10bde5c1006412be06998e3cff2624","observation_id":"672889be-de83-492a-8334-d73da03b3c3f","resolution":{"observed_at":"2026-08-11T12:22:38.874322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08041","last_updated":"2024-04-06T10:22:57Z","snapshot_observed_at":"2026-08-16T14:52:50.059474Z","submitted_at":"2023-10-12T05:25:49Z","title":"QLLM: Accurate and Efficient Low-Bitwidth Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08041","snapshot_observed_at":"2026-08-11T12:22:38.878253Z","title":"QLLM : Accurate and efficient low-bitwidth quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.878253Z"},"links":{"cited_paper":"/paper/2310.08041","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ad2027b234512e41f63637053fe3b601a8dfbd8658c9db800951075572e7a562","observation_id":"02159c26-b30b-4751-8b7a-edb233335d2d","resolution":{"observed_at":"2026-08-11T12:22:38.878253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-08-13T16:44:59.404632Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-11T12:22:38.882488Z","title":"RepoBench : Benchmarking repository-level code auto-completion systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.882488Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:3b69f5669b0eb1c4f74e580a58957d8742ade96d0a65e611f015bfa48444c85e","observation_id":"a409a826-96ac-4f73-a143-d94ac889b68e","resolution":{"observed_at":"2026-08-11T12:22:38.882488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-11T12:22:38.885979Z","title":"KIVI : A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.885979Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:462a328b70995fee0f9a578ec7a8ca9cf403539bbe302357830069c9416eb015","observation_id":"a384ac31-e490-4143-920b-a8521ea8b37b","resolution":{"observed_at":"2026-08-11T12:22:38.885979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-08-16T17:18:05.876361Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-11T12:22:38.889642Z","title":"SpinQuant : Llm quantization with learned rotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.889642Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:2c6df5032eb74a888c54af34c02dddcea0f74105162bfba024ae14e1be331fcd","observation_id":"ada04707-734b-4730-a56a-be7f57fb5790","resolution":{"observed_at":"2026-08-11T12:22:38.889642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-11T12:22:38.893145Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.893145Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:a4edc6e4fbc914ee749a58dc38f218529c763856ba99d73802b8c7fce8e4fed6","observation_id":"657afab0-bffc-4382-9b2d-d373b37bc0e7","resolution":{"observed_at":"2026-08-11T12:22:38.893145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.809216Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models , 2024 a","venue":null,"work_id":"6689d0ca-c1fc-41f1-a505-7e15d305f975","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.896642Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:c66f198628178ee9816934fcdec09ed7e8cb812908fdef98648685ef3f091885","observation_id":"7e525663-48d4-4e72-bfa3-8bf9528542f0","resolution":{"observed_at":"2026-08-11T12:22:39.813238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.797663Z","title":"Introducing Meta Llama 3: The most capable openly available LLM to date","venue":null,"work_id":"e5687d44-14b4-44aa-b594-56468f84c719","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.900006Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:66b6583945ae5d191fdeed2f36be4107e8bda3a72d5e763078d021772cdce6ce","observation_id":"71408979-c82a-4e96-84d7-4e1d34ae3197","resolution":{"observed_at":"2026-08-11T12:22:39.801562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.903241Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.903241Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ecdf968ac6de3b816175d9ed52e89719eceb59a57f16ee0742e68e5612f29542","observation_id":"bbfbb140-674e-4a7a-bc1f-b9094136d1c0","resolution":{"observed_at":"2026-08-11T12:22:38.903241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09557","last_updated":"2024-04-01T06:09:41Z","snapshot_observed_at":"2026-08-16T16:51:52.635088Z","submitted_at":"2022-06-20T03:48:17Z","title":"LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09557","snapshot_observed_at":"2026-08-11T12:22:38.906855Z","title":"J., Kim, B., Lee, Y., and Lee, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.906855Z"},"links":{"cited_paper":"/paper/2206.09557","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:ea40493974af8cdf3893be3cdf8dc1a93e6e407b191caa4f07ef88c5ed13d73c","observation_id":"2abd8d63-e3fd-4201-bb72-1a8e6559d684","resolution":{"observed_at":"2026-08-11T12:22:38.906855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.910471Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.910471Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:8306f9d3788168a7e4ef4513b3a922b9abfb16989f62e9bb89a144d3d95c49c4","observation_id":"96cef960-686f-4279-9847-37ee47d223ca","resolution":{"observed_at":"2026-08-11T12:22:38.910471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.773143Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":"80af6799-b0cd-407b-b896-7c2cd74f12b4","year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.913876Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:5db8e70732acab068425196ab173d2f9aa2e67e7c97b149ab96940d65d611ad7","observation_id":"51a6c593-6f2c-4792-9f37-ba3063208c1f","resolution":{"observed_at":"2026-08-11T12:22:39.777147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05437","last_updated":"2024-10-07T18:59:22Z","snapshot_observed_at":"2026-08-16T13:11:46.336978Z","submitted_at":"2024-10-07T18:59:22Z","title":"ESPACE: Dimensionality Reduction of Activations for Model Compression","version":1},"cited_work":{"arxiv_id":"2410.05437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05437","snapshot_observed_at":"2026-08-11T12:22:39.278573Z","title":"ESPACE: Dimensionality Reduction of Activations for Model Compression","venue":"cs.LG","work_id":"ed1949cd-bef3-499e-9837-0b016fd3e2de","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.917322Z"},"links":{"cited_paper":"/paper/2410.05437","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:60c2f349431f883a304349ba180c60b4d3853cb4f5d51a04316b8fffbed9d315","observation_id":"2f89d0e0-1866-4a9c-be81-8e66a142ad62","resolution":{"observed_at":"2026-08-11T12:22:39.284687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.762139Z","title":"Social iqa: Commonsense reasoning about social interactions","venue":null,"work_id":"5906d38b-6576-464f-a1fe-85be07f00349","year":2019},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.921067Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0f38f2fa599e0001dd590925432c3a1d5aff6d988d28de23752b29aa2d9b3293","observation_id":"cd559363-2a2b-4f94-977b-17763261db36","resolution":{"observed_at":"2026-08-11T12:22:39.765854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.924318Z","title":"Eigen attention: Attention in low-rank space for KV cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.924318Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:dbbccef14bc3cd36efd07b0349b27426ae6d172048ae1d81c4ce199cae514feb","observation_id":"1ad94519-701c-4131-85b9-67b86ff644e7","resolution":{"observed_at":"2026-08-11T12:22:38.924318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-16T15:05:54.961547Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-11T12:22:38.927992Z","title":"OmniQuant : Omnidirectionally calibrated quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.927992Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:fd33986966a2e07ba3e14ddf8004bab5c73e504436b4822b423194aa5c4b7ac8","observation_id":"1c7b3e8d-46a8-40e0-ac33-5946b21554a6","resolution":{"observed_at":"2026-08-11T12:22:38.927992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.751138Z","title":"Post training quantization of large language models with microscaling formats","venue":null,"work_id":"85601121-0033-41d8-bb49-f78d1b92f21e","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.931852Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:3125a7f22b1b549c299cf1d180f3c5336df1b5e7d1d2c9574ec1f98d4a9c03e2","observation_id":"bbdb286d-76dd-496f-968e-2e0daafb0ce1","resolution":{"observed_at":"2026-08-11T12:22:39.755113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.739883Z","title":"FlexGen : High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"530ef983-5412-4988-a9cb-a296676eb061","year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.935507Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:4063a82c13c9fcf3f0e1af8c289ff9bd559122fd04e072153ba85a6584ea7851","observation_id":"c44c37e3-0c88-4b40-a9de-4b43cd10ed19","resolution":{"observed_at":"2026-08-11T12:22:39.743866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.729106Z","title":"CUTLASS , January 2023","venue":null,"work_id":"d4dcf0ce-234a-45e8-b521-b252f96ba8d4","year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.938871Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:00617247a3d0d05cffc2c273648f148466c6e460f094d0fb2252adc8aceaa4e9","observation_id":"0e18ae65-d51c-4214-8b61-b6d113c7b9a9","resolution":{"observed_at":"2026-08-11T12:22:39.732878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T12:22:38.942577Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.942577Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:52a930a898e96b08b4442768c1797b270d366864603da7b60dec1f0894b8bc83","observation_id":"ae6c5a15-afcb-4760-8200-43a06e826daf","resolution":{"observed_at":"2026-08-11T12:22:38.942577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04396","last_updated":"2024-06-04T04:51:52Z","snapshot_observed_at":"2026-08-16T14:20:50.908439Z","submitted_at":"2024-02-06T20:52:12Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04396","snapshot_observed_at":"2026-08-11T12:22:38.946066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.946066Z"},"links":{"cited_paper":"/paper/2402.04396","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:a64a4dfb6b7bc92bfa0500b49e2ab447f20fd98e2aa22d7e956cd5dc5c63f1ba","observation_id":"e6a3954c-345d-457a-a317-1c830cb69079","resolution":{"observed_at":"2026-08-11T12:22:38.946066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T12:22:38.949786Z","title":"Qwen2-VL : Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.949786Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:054f7dc0c389cd2920686cc00e195493e54d5d0c732a6d4fc9bebe48743b98c2","observation_id":"a24d496d-dfa2-4b16-9fb1-8f5f6267e687","resolution":{"observed_at":"2026-08-11T12:22:38.949786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-11T12:22:38.953613Z","title":"L., Gugger, S., Drame, M., Lhoest, Q., and Rush, A","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.953613Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:89451bae0617c00fe1be4b323509caa81ea4e83ae09846cf5286811685b7f9d2","observation_id":"f376dde5-0c87-4d47-9ce2-ec305c96d1ec","resolution":{"observed_at":"2026-08-11T12:22:38.953613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.717800Z","title":"Training transformers with 4-bit integers","venue":null,"work_id":"9de5994c-7d3e-4857-adb5-ea2a0591350c","year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.957266Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:74280ffa549bef48f90a7c71dc1b3d51738354ff35553677462c7299ac702cb6","observation_id":"b9d1323a-5e62-499c-b10c-edb95c4170a4","resolution":{"observed_at":"2026-08-11T12:22:39.721622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:38.960869Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.960869Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:097322a0210a6665a4c1d1a19d263a21b03b8767af1d297454c4963a605f239d","observation_id":"d1cd3c1c-d13b-4952-9c5e-cf547ed10e8d","resolution":{"observed_at":"2026-08-11T12:22:38.960869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T12:22:38.964652Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.964652Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:196ef56b40bc9e5db9fb08e2e189c0bbf69281f180f4f487df17ca41e12a540b","observation_id":"cefbaddf-3a47-45ac-a991-1b22181e5166","resolution":{"observed_at":"2026-08-11T12:22:38.964652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-16T14:14:39.490675Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-11T12:22:38.968304Z","title":"Y., Kim, B., Bae, J., Kwon, B., Park, G., Yang, E., Kwon, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.968304Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:cf13fe6fae6952acb259b1187ff39ed81b6ae9637648a15f21c307d45b62fa71","observation_id":"3ba31ebb-25e1-45fb-92bd-33a7d3d2f5d6","resolution":{"observed_at":"2026-08-11T12:22:38.968304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.700643Z","title":"ZeroQuant : Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"894a6ed3-2538-49d8-b180-94231eaaf5be","year":2022},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.972203Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:88b0947bc96f00a21ec51cb8d707654e002941b0342a896a2b2319b9bf930cf0","observation_id":"e1b72ddd-8ca1-4837-8e6d-45c1e7ce89af","resolution":{"observed_at":"2026-08-11T12:22:39.704547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01089","last_updated":"2023-05-17T10:07:33Z","snapshot_observed_at":"2026-08-16T15:43:09.896060Z","submitted_at":"2023-04-03T15:46:15Z","title":"RPTQ: Reorder-based Post-training Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01089","snapshot_observed_at":"2026-08-11T12:22:38.975957Z","title":"RPTQ : Reorder-based post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.975957Z"},"links":{"cited_paper":"/paper/2304.01089","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:0ee76f1aa26c20d074304f87cfeea7ef150e112cb48115a8c572d429073bb409","observation_id":"bfdc818f-8b94-49fe-811a-552d050a3e62","resolution":{"observed_at":"2026-08-11T12:22:38.975957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-08-16T15:03:40.750477Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05821","snapshot_observed_at":"2026-08-11T12:22:38.979639Z","title":"ASVD : Activation-aware singular value decomposition for compressing large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.979639Z"},"links":{"cited_paper":"/paper/2312.05821","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:bfdfd3eed28a4d68958ea648e264d47bc3bfe21e2fc104faf0176599efd5d168","observation_id":"640b47c3-9b34-4981-8d9f-570908d32951","resolution":{"observed_at":"2026-08-11T12:22:38.979639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T12:22:38.983535Z","title":"MMMU : A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.983535Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:4c622396085eb6698f00d2d8103dc486b1612cb02fe58ec8f8a75b0d27066ed1","observation_id":"62b9c7e8-dff2-47be-8ce9-34a270e56684","resolution":{"observed_at":"2026-08-11T12:22:38.983535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-11T12:22:38.987961Z","title":"HellaSwag : Can a machine really finish your sentence? arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.987961Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:6d08fc324ab1a1f836ccab7409674be9e2edbc0a4b3f8bbf310dc221eed1adc9","observation_id":"6768f08d-6eb8-4a9f-b10d-ea272f8c4cba","resolution":{"observed_at":"2026-08-11T12:22:38.987961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08554","last_updated":"2025-07-27T12:44:00Z","snapshot_observed_at":"2026-08-16T13:26:05.695532Z","submitted_at":"2024-08-16T06:39:08Z","title":"ABQ-LLM: Arbitrary-Bit Quantized Inference Acceleration for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08554","snapshot_observed_at":"2026-08-11T12:22:38.991673Z","title":"ABQ-LLM : Arbitrary-bit quantized inference acceleration for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.991673Z"},"links":{"cited_paper":"/paper/2408.08554","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:d184a87bdb6ae7292729b11f5b1f52d230772dc431a329fb9ad71cecd3a9e3c4","observation_id":"e6ec41da-6b92-4b3d-97ed-afbeef829b46","resolution":{"observed_at":"2026-08-11T12:22:38.991673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.689207Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving","venue":null,"work_id":"a8f88621-854c-40f1-a4f8-df490deee13c","year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.995854Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:f1d575bc707945a694c5eaebe83fc46b75c64782077d1908d07fbefecdfe7192","observation_id":"ba34eb41-461d-413b-98c4-71b9beb7e17e","resolution":{"observed_at":"2026-08-11T12:22:39.693096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.677721Z","title":"QMSum : A new benchmark for query-based multi-domain meeting summarization","venue":null,"work_id":"014d305e-a039-4cbe-896a-8fedfbd6aa2e","year":2021},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.999640Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:35166b436d7361c5c029647f4fd7f271ca91c39b356130939c122ac822537607","observation_id":"82f4e82c-5f7c-4893-adf2-93f52d8046fc","resolution":{"observed_at":"2026-08-11T12:22:39.681667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:22:39.003914Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:39.003914Z"},"links":{"citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:be284696ba94bcf6078bae41db048917651c9480d287b9d5978679ee64628f0a","observation_id":"0b525f8a-5d78-4922-8207-1dc469f4a69c","resolution":{"observed_at":"2026-08-11T12:22:39.003914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T00:10:37.377984Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 9 inbound Pith citation observations for arXiv:2412.14363."}