{"as_of":"2026-08-14T07:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a5448724610b9c624dea1a2e83b24814205151c78af296c8e09c2444f213e57","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:55.423637Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T05:41:13.869451Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T05:50:43.590536Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05664","snapshot_observed_at":"2026-07-05T05:50:43.590536Z","title":"Avg. Bits","venue":null,"work_id":"347d84af-c490-4a83-932e-db0386251b5e","year":2025},"citing_paper":{"arxiv_id":"2512.04746","last_updated":"2026-05-18T07:28:29Z","snapshot_observed_at":"2026-08-14T03:20:36.313695Z","submitted_at":"2025-12-04T12:35:10Z","title":"SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T17:08:05.945757Z"},"links":{"cited_paper":"/paper/2506.05664","citing_paper":"/paper/2512.04746"},"observation_digest":"sha256:7590b67b86abd4c03722fac88c333ce23018aaf21a6ac592951c2378fecb6712","observation_id":"196ce1c7-1a55-4e9f-98e8-714d0a7fa3c2","resolution":{"observed_at":"2026-05-21T17:10:24.851205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05664","snapshot_observed_at":"2026-07-05T05:50:43.590536Z","title":"Avg. Bits","venue":null,"work_id":"347d84af-c490-4a83-932e-db0386251b5e","year":2025},"citing_paper":{"arxiv_id":"2605.06675","last_updated":"2026-06-26T01:41:50Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T02:31:58Z","title":"RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T01:09:21.811344Z"},"links":{"cited_paper":"/paper/2506.05664","citing_paper":"/paper/2605.06675"},"observation_digest":"sha256:1ae95acd56e371d38e53f2be9f98d32442ea354fa9fd6d55203b8d89860f83dd","observation_id":"db559af4-13dd-4bac-9c2a-f077de7e7051","resolution":{"observed_at":"2026-05-11T04:40:59.669846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.05664","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05664","snapshot_observed_at":"2026-07-05T05:50:43.590536Z","title":"Avg. Bits","venue":null,"work_id":"347d84af-c490-4a83-932e-db0386251b5e","year":2025},"citing_paper":{"arxiv_id":"2605.06675","last_updated":"2026-06-26T01:41:50Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T02:31:58Z","title":"RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-05T05:41:13.869451Z"},"links":{"cited_paper":"/paper/2506.05664","citing_paper":"/paper/2605.06675"},"observation_digest":"sha256:6866c2fbeddf2bc163837f3f5ef088d0dbfdc0786933c51f390282bd877ef7b2","observation_id":"6267c1b7-0ebd-46ce-94bf-35493f06b28f","resolution":{"observed_at":"2026-07-05T05:50:43.592486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05664/citation-record","integrity":"/paper/2506.05664/integrity","json":"/paper/2506.05664/citation-record.json","paper":"/paper/2506.05664"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.801191Z","title":"Introducing ChatGPT.OpenAI Blog","venue":null,"work_id":"c7ce1d89-2b7a-46d8-9482-881e02b7f8ac","year":null},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.125122Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:583de41fd63622a8a8a87761aa68786373924de3f31a4a5c8ed7239ef2bb5396","observation_id":"d542fac4-a47a-4dfa-93b8-fb721f8ba1f6","resolution":{"observed_at":"2026-08-07T10:18:58.981600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.215053Z","title":"Qlora: Efficient finetuning of quantized llms.Advances in neural information processing systems, 36:10088– 10115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.215053Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:59bd5a031fcc1e01eb1586a638fcbafc46c4ab053829d9daf4f4e55288f80631","observation_id":"01ae5068-8aa3-42a2-bb3f-e8dc07648b74","resolution":{"observed_at":"2026-08-07T10:18:51.215053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.356767Z","title":"OPTQ: Accurate quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.356767Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:b3b3d166235c0047822c09bf6d6f75c95eaadbd0ccb95beee5a4ea0bdcdc5eeb","observation_id":"d37587dc-eb2b-445b-8843-73e5bf796cd0","resolution":{"observed_at":"2026-08-07T10:18:51.356767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-07T10:18:51.557589Z","title":"Bitnet: Scaling 1-bit transformers for large language models.arXiv preprint arXiv:2310.11453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.557589Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:6c0cab78358122b248e34247667fdfa95e972dbd05bc95dd4e30974a0036bdac","observation_id":"c4638107-943c-4efa-842d-ece7443e4e08","resolution":{"observed_at":"2026-08-07T10:18:51.557589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.556204Z","title":"QuIP: 2-bit quantization of large language models with guarantees","venue":null,"work_id":"61f24f6a-44de-485d-b075-54e15ac6c5e7","year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.709490Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:c02a8eb0cb7eea7271a90eb7a52be07968270286119843c0bafe3e8df35fd6e7","observation_id":"adbbb647-40a9-4e9f-b99c-bc4e58e2d344","resolution":{"observed_at":"2026-08-07T10:18:58.643512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.833564Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:51.833564Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:443bb0d8e3f7c5690bfeba4402bbffea400af64b433bfe9ca143c42fd5ac3b34","observation_id":"56f249c7-4c10-407a-bcfc-4a6227bbbff0","resolution":{"observed_at":"2026-08-07T10:18:51.833564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.035060Z","title":"Omniquant: Omnidirectionally calibrated quan- tization for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.035060Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:e145f26062654578b3031bc9725156715a0de25c13a175f436835aba2f196347","observation_id":"825ef0da-5999-4b78-9e0e-5247cf497052","resolution":{"observed_at":"2026-08-07T10:18:52.035060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.178887Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.178887Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:51ef93696294a3e8a9a6459428902294c4cdfecd6f1d219578b490cbab5ce9bd","observation_id":"991ba312-d4ad-4764-8e7e-2ebcca51e8a8","resolution":{"observed_at":"2026-08-07T10:18:52.178887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.315397Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.315397Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:0a955b43b419c160ffa87001499e8f6ebf314d971af9b15783728f5dee41c8b6","observation_id":"f28f6709-fb4c-4d74-b87c-bdbdfe264093","resolution":{"observed_at":"2026-08-07T10:18:52.315397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.490197Z","title":"Owq: Outlier- aware weight quantization for efficient fine-tuning and inference of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.490197Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:b48f3622c3e8653d478f218ca0c728f474dafc50cd08790fb2a07360edcf40d0","observation_id":"c08e9e6a-75e3-4440-a082-d8b03450aba9","resolution":{"observed_at":"2026-08-07T10:18:52.490197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-13T11:18:21.844753Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-07T10:18:52.624716Z","title":"Squeezellm: Dense-and-sparse quantization.arXiv preprint arXiv:2306.07629, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.624716Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:7d0b64ec231ac6f79de57e5b8fb063576a8e9a6d584f6192c3ab43b7165455df","observation_id":"35aa94be-e2a4-4b81-aa83-0b824d01744a","resolution":{"observed_at":"2026-08-07T10:18:52.624716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.749496Z","title":"Svirschevski, Vage Egiazarian, Denis Kuznedelev, Elias Frantar, Saleh Ashkboos, Alexander Borzunov, Torsten Hoefler, and Dan Alistarh","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.749496Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:e744b84406c3d03702d76a7caf01370c70d217aad81da3d3cf7be1a46967f31a","observation_id":"6b7e28c6-9be5-4042-b20e-ccb2a8fb9961","resolution":{"observed_at":"2026-08-07T10:18:52.749496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:58.192581Z","title":"Optimal brain surgeon and general network pruning","venue":null,"work_id":"f25127e7-20ea-43ea-870c-76051070c451","year":1993},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:52.920639Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:9c4de5ecec1c96271f30e4331dc9044dbb843d38aff3d0bcde68c5107ce089a7","observation_id":"52fbcbee-8dc5-48c3-b17d-615644050114","resolution":{"observed_at":"2026-08-07T10:18:58.376113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.069213Z","title":"Optimal brain damage.Advances in neural information processing systems, 2, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.069213Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:fc6492b08917dd347b9347120bb87c29de2888b1e6f8fffe99f726821f8861f5","observation_id":"c011a7f5-878c-40ab-836e-7053d7aa0c89","resolution":{"observed_at":"2026-08-07T10:18:53.069213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.922879Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"28b9757a-0825-457c-8a2e-a1072afc51c7","year":2023},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.189419Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:fca2dea14378d86b68f6ec2d733af4e3fbbda1daf7afb4d98dad520a40311c13","observation_id":"e00c5e90-9f8a-4caf-8480-2c0e09f4f89c","resolution":{"observed_at":"2026-08-07T10:18:58.061585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.356799Z","title":"Optimal brain compression: A framework for accurate post- training quantization and pruning.Advances in Neural Information Processing Systems, 35:4475– 4488, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.356799Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:7788856e75a74afb301a8f72f9b9735fc2fa53b3f0f8e3243e51f72e55c6d744","observation_id":"20cf8c7a-20cf-4c73-a47d-3e33a7b449c2","resolution":{"observed_at":"2026-08-07T10:18:53.356799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-13T15:50:33.443969Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-07T10:18:53.534133Z","title":"BiLLM: Pushing the limit of post-training quantization for LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.534133Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:df6968b8d10d67e772e553551b5c203427f25a8d4af94392f0ca0611b2c554a4","observation_id":"1e388151-715e-4228-b3cf-11399f60e860","resolution":{"observed_at":"2026-08-07T10:18:53.534133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.582438Z","title":"Gray and David L","venue":null,"work_id":"633c117e-9b25-4525-9b47-b337a8a829c5","year":1998},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.742757Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:dfe495565833ae273775d0917e4959d5927d7733ecc63e11982ea7b27b7de44d","observation_id":"767b367f-c3e5-41fd-9517-9335576483a1","resolution":{"observed_at":"2026-08-07T10:18:57.715317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.878901Z","title":"John Wiley & Sons, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:53.878901Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:53e06baf66061a4f4d13e984516f3abbf81d34eb9055b683e80cde4909b51d6b","observation_id":"a549fd08-e043-4463-a65f-5907fc04c75e","resolution":{"observed_at":"2026-08-07T10:18:53.878901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:57.226491Z","title":"Jpeg2000: Image compression fundamentals, standards and practice.Journal of Electronic Imaging, 11(2):286–287, 2002","venue":null,"work_id":"4a851238-bef5-47c1-99b8-9f2ee5bc56b5","year":2002},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.023364Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:87be915c02c44640bd4c8466c389fe6e14a5ee4f944ee8f754669c5cc05e250c","observation_id":"c8d1f918-2e0c-40cb-aefc-0f4f22b8207d","resolution":{"observed_at":"2026-08-07T10:18:57.352361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.104520Z","title":"Springer Science & Business Media, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.104520Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:dc7a3673e8f4597b613ec6288bc4f8ca797c5378c179e3b594b1e78ea926156b","observation_id":"f486d404-4f12-4790-b780-fea2a955d48d","resolution":{"observed_at":"2026-08-07T10:18:54.104520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T10:18:54.262302Z","title":"Diab, Xian Li, Xi Victoria Lin, Todor Mihaylov, Myle Ott, Sam Shleifer, Kurt Shuster, Daniel Simig, Punit Singh Koura, Anjali Sridhar, Tianlu Wang, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.262302Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:7768d7fa2196880aab5bcb1e428482b6104de4732f2a653e3d4d3fbc6a1f240a","observation_id":"dde2d55b-4767-4ea0-bb7d-46e6631a94c3","resolution":{"observed_at":"2026-08-07T10:18:54.262302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.443826Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.443826Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:413ffdc0bb06078dca2085c4ec334228f94648db27dfc17da08e17ec37cad2eb","observation_id":"cc1f0635-fd71-45ba-9a48-a4c83394244d","resolution":{"observed_at":"2026-08-07T10:18:54.443826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T10:18:54.621632Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.621632Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:843b19f49407ffeffa0f304e5150216323c517c9355763c464c78044fb4807a9","observation_id":"403ab597-f344-4cff-9ee5-8511a7f80c6f","resolution":{"observed_at":"2026-08-07T10:18:54.621632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.891415Z","title":"The Penn Treebank: Annotating predicate argument structure","venue":null,"work_id":"e4ba58f7-35ce-4221-875e-ca98b792e7d4","year":1994},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:54.807264Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:6df4777db008cd6982fb839bb8e02e75622c0267422249e9dde6f66d64234b66","observation_id":"34702f25-e960-4259-8b8a-e4a69673bc55","resolution":{"observed_at":"2026-08-07T10:18:57.082435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.407062Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"5de51e6e-f16a-46d3-a561-f9f69e8d6c84","year":2016},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:55.087121Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:8c049dc10f6463e5eb3c49fe65e1e531c19619f84d95da66796620e8c03ed19f","observation_id":"8e0adfe8-8572-40f5-a731-c30a19440f50","resolution":{"observed_at":"2026-08-07T10:18:56.608156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:56.134289Z","title":"Piqa: An algebra for querying protein data sets","venue":null,"work_id":"ed31dc3b-178c-4a94-893c-43502ceb69c3","year":2003},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:55.236048Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:f80acfc400b5b05401e2eb66374f3fd32e53bcedfc8b7e552c01a5eedccf4266","observation_id":"3d4a6eec-b3dc-41ef-84eb-9abcfb0959b8","resolution":{"observed_at":"2026-08-07T10:18:56.247548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.704828Z","title":"A systematic classification of knowl- edge, reasoning, and context within the ARC dataset","venue":null,"work_id":"fdf1e648-137a-4065-aa29-fed61bd01a18","year":2018},"citing_paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:55.423637Z"},"links":{"citing_paper":"/paper/2506.05664"},"observation_digest":"sha256:88cdd33c56354f6d4a39114d0aa248e7a0f29214962a163310991f155502bc3a","observation_id":"e378cbbd-1a98-4b0f-9598-387bd629d825","resolution":{"observed_at":"2026-08-07T10:18:55.902652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05664","last_updated":"2025-06-06T01:27:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T07:02:15.017963Z","submitted_at":"2025-06-06T01:27:01Z","title":"BAQ: Efficient Bit Allocation Quantization for Large Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2506.05664."}