{"as_of":"2026-08-11T06:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:857ae8f1f4a164f0b7a1e84d7f7a9cd0a5e4749b14d164edb669af96bf617533","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:44:30.222315Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:31:28.053090Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2501.01144","doi":"10.48550/arxiv.2501.01144","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"47a2d90c-2608-430a-8cd2-b301809d3e8e","year":2025},"citing_paper":{"arxiv_id":"2606.00365","last_updated":"2026-05-29T21:07:27Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:07:27Z","title":"SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T19:31:28.053090Z"},"links":{"cited_paper":"/paper/2501.01144","citing_paper":"/paper/2606.00365"},"observation_digest":"sha256:803606684144c156a96a0487fc3a8ebb516f4df9c3bdeb7325e5999f86fe0ff9","observation_id":"fe7fbe63-008d-49dd-99cb-af5d1d277a18","resolution":{"observed_at":"2026-06-28T19:32:34.309836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01144/citation-record","integrity":"/paper/2501.01144/integrity","json":"/paper/2501.01144/citation-record.json","paper":"/paper/2501.01144"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-10T22:25:06.219020Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-10T22:44:30.059448Z","title":"C., Rastegari, M., and Fara- jtabar, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.059448Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:f3f46ac8b1bbe1829a62696a30c6f9eb73839e9eab4ac050465bfe6f3d13e526","observation_id":"59c233a4-120d-470f-b98c-b007632f82a6","resolution":{"observed_at":"2026-08-10T22:44:30.059448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-10T22:44:30.075869Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.075869Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:a29abf1aaef9af340e9db31836e229be3bc1ff370855b63caa3e359a8a99917d","observation_id":"5730738b-99fe-49ed-a07a-4295aaab48a5","resolution":{"observed_at":"2026-08-10T22:44:30.075869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03103","last_updated":"2024-06-10T23:41:18Z","snapshot_observed_at":"2026-08-10T23:15:09.894221Z","submitted_at":"2024-05-06T01:39:59Z","title":"Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMs","version":2},"cited_work":{"arxiv_id":"2405.03103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.03103","snapshot_observed_at":"2026-08-10T22:44:30.648890Z","title":"Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMs","venue":"cs.LG","work_id":"b1e80ee0-f14e-4156-a3bb-5cd9edaec371","year":2024},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.091674Z"},"links":{"cited_paper":"/paper/2405.03103","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:a410f6bf04c8cde50ed13c2540efd4b58f178399e6893f00daef60bb20d3988c","observation_id":"de82ca2d-16c6-454f-93cd-0ebcd8d9434d","resolution":{"observed_at":"2026-08-10T22:44:30.653784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:44:30.097173Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.097173Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:5ef3df25b1dc57e70a839bcdd9969d3bc42d6445507e53b8ce50150ae0678e7b","observation_id":"6845930e-22d5-46b2-b580-465d4fbe2a77","resolution":{"observed_at":"2026-08-10T22:44:30.097173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06118","last_updated":"2024-09-11T07:48:26Z","snapshot_observed_at":"2026-08-10T09:15:23.437294Z","submitted_at":"2024-01-11T18:54:44Z","title":"Extreme Compression of Large Language Models via Additive Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06118","snapshot_observed_at":"2026-08-10T22:44:30.102307Z","title":"Extreme Compression of Large Language Models via Additive Quantization.arXiv preprint arXiv:2401.06118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.102307Z"},"links":{"cited_paper":"/paper/2401.06118","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:da448a66b74e634d65caa61619cad9bfe46a693fcf8d03cefab313da1bc37c4c","observation_id":"66c5d3b4-f15c-4449-8cb2-7a52421e01cb","resolution":{"observed_at":"2026-08-10T22:44:30.102307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.107005Z","title":"BCQ: Block Clustered Quantization for 4-bit (W4A4) LLM Inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.107005Z"},"links":{"citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:579c6896c0fda5698f9dcdf4c868a7df9cd92f5c26871757aa24b0da241cab7c","observation_id":"44839155-e3cc-4ca0-9edd-e8f9df445a1a","resolution":{"observed_at":"2026-08-10T22:44:30.107005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T22:44:30.115643Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.115643Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:d62b9e118375f35fb59592463807b08117015d327f2394d53991dac7d8109bd3","observation_id":"abd3db42-e086-469b-afd7-86e140747b2e","resolution":{"observed_at":"2026-08-10T22:44:30.115643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T22:44:30.124358Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.124358Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:996a386ded5c1f7fa9f08caad2073a839ae1cef9a99208486fdcc12096ba38e2","observation_id":"12508ec8-b29a-4e3d-b6eb-f5b092297b26","resolution":{"observed_at":"2026-08-10T22:44:30.124358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-10T23:43:21.615256Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-08-10T22:44:30.128860Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.128860Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:351591188e286228bf6f5005e1e7164c38a2df3c6fd5ce044db5d3da57a4341d","observation_id":"7d957495-3395-43b2-b49d-98a464d2b749","resolution":{"observed_at":"2026-08-10T22:44:30.128860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15987","last_updated":"2023-08-30T12:18:18Z","snapshot_observed_at":"2026-08-11T00:36:17.296585Z","submitted_at":"2023-08-30T12:18:18Z","title":"FPTQ: Fine-grained Post-Training Quantization for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15987","snapshot_observed_at":"2026-08-10T22:44:30.133415Z","title":"FPTQ: Fine-Grained Post-Training Quantization for Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.133415Z"},"links":{"cited_paper":"/paper/2308.15987","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:c3e53af75ef95878e91372f60e73048ad9a22d72b395067d09530f95c4908c93","observation_id":"845afe81-1327-4b44-ae0e-bd8772d76f91","resolution":{"observed_at":"2026-08-10T22:44:30.133415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16836","last_updated":"2023-10-25T17:59:32Z","snapshot_observed_at":"2026-08-07T20:37:03.856800Z","submitted_at":"2023-10-25T17:59:32Z","title":"LLM-FP4: 4-Bit Floating-Point Quantized Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16836","snapshot_observed_at":"2026-08-10T22:44:30.137644Z","title":"LLM-FP4: 4-bit Floating-Point Quantized Transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.137644Z"},"links":{"cited_paper":"/paper/2310.16836","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:2427570c2bc485bd0f44ef13fe30e1e70f3a0242220705cadcc2e8dc6902ea3d","observation_id":"ab32f4d4-f661-4a35-966a-79d4cfc4a8fe","resolution":{"observed_at":"2026-08-10T22:44:30.137644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-10T22:44:30.142155Z","title":"KIVI: A Tuning-Free Asym- metric 2bit Quantization for KV Cache","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.142155Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:007369b8bcfcab8af75b2b8d8ac7ae155078e0e0c62c7fd104311487cb483589","observation_id":"6fd60780-c798-4c51-a749-3164d5e1d12e","resolution":{"observed_at":"2026-08-10T22:44:30.142155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-10T22:44:30.147521Z","title":"Pointer Sentinel Mixture Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.147521Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:3307b79a0996e79dedf6ecf4bae81104c71ad4e2125e36bb079ba63108be7b67","observation_id":"620618b6-9e81-41a0-acc5-3d44f4f5853e","resolution":{"observed_at":"2026-08-10T22:44:30.147521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-10T22:44:30.157115Z","title":"D., Zhao, R., Elango, V ., Shafipour, R., Hall, M., Mesmakhosroshahi, M., More, A., Melnick, L., Golub, M., Varatkar, G., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.157115Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:0509df821213c933dd22535b525280dc3d15a2944bc327d05c3b9bdde0b268ea","observation_id":"30a922f6-ae9a-4391-9fc2-12d018e30109","resolution":{"observed_at":"2026-08-10T22:44:30.157115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04093","last_updated":"2025-02-09T16:06:53Z","snapshot_observed_at":"2026-08-06T20:00:26.901131Z","submitted_at":"2024-08-07T21:16:55Z","title":"Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04093","snapshot_observed_at":"2026-08-10T22:44:30.161918Z","title":"Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.161918Z"},"links":{"cited_paper":"/paper/2408.04093","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:5ebee28db4cca7b060c9f07ed5bea81e3a6f951e0f1ce8fdd0e5dfad8d103eab","observation_id":"45e330fa-b746-4e55-8786-03d9f1dd90ed","resolution":{"observed_at":"2026-08-10T22:44:30.161918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09203","last_updated":"2019-11-13T03:54:12Z","snapshot_observed_at":"2026-08-03T18:37:05.537362Z","submitted_at":"2019-08-24T20:41:40Z","title":"Release Strategies and the Social Impacts of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09203","snapshot_observed_at":"2026-08-10T22:44:30.167061Z","title":"W., Kreps, S., et al","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.167061Z"},"links":{"cited_paper":"/paper/1908.09203","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:e0b169a9e04ef0b55c03151c3640d8f252e3e4b5d7f21b146dd82374a5f1d3b0","observation_id":"fa2e2a66-609a-43b6-91b9-f657944f403b","resolution":{"observed_at":"2026-08-10T22:44:30.167061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:44:30.171823Z","title":"Llama 2: Open Foundation and Fine- Tuned Chat Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.171823Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:df02b92ed552af1b8d8e947f4e283590f3bd19b22ce532f4a9feff42dba6e094","observation_id":"6b41623d-4886-43d5-a8e0-207e4be94fc1","resolution":{"observed_at":"2026-08-10T22:44:30.171823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04396","last_updated":"2024-06-04T04:51:52Z","snapshot_observed_at":"2026-08-10T20:22:11.583524Z","submitted_at":"2024-02-06T20:52:12Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04396","snapshot_observed_at":"2026-08-10T22:44:30.175978Z","title":"QuIP#: Even Better LLM Quantization with Hadamard Incoherence and Lattice Codebooks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.175978Z"},"links":{"cited_paper":"/paper/2402.04396","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:423674bc9bbedfa507ed414ef22d7c67a995cc22edef16f09aaa5214805fe85e","observation_id":"8116dac2-c1ee-4493-a86f-e24760ad3bdb","resolution":{"observed_at":"2026-08-10T22:44:30.175978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-10T22:44:30.180277Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.180277Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:d0d0a19e79154cab935f90049e8c861f661a29223c153be8e461fad7376f512c","observation_id":"c9ee65de-9815-4904-a74b-f6315e105749","resolution":{"observed_at":"2026-08-10T22:44:30.180277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-10T22:44:30.189163Z","title":"J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.189163Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:83a16a8fee815a4e20ed43ce513825e30441de11e91e4ae1be46dad407a3f467","observation_id":"8b644334-71ea-409b-bab9-a42091015223","resolution":{"observed_at":"2026-08-10T22:44:30.189163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T22:44:30.193758Z","title":"Hellaswag: Can a Machine Really Finish Your Sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.193758Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:b61ada0ac1421d63005536d55fa08ff3c288c968419a38a7e5fea260b5853fba","observation_id":"bae98df9-0dae-4ba3-826d-c91b58bb71fe","resolution":{"observed_at":"2026-08-10T22:44:30.193758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-10T22:44:30.198608Z","title":"V ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.198608Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:79127700d51d44a4b9aa56fa57f884b384e5c793e32848d4bd5b79fe6a68bb45","observation_id":"443379e9-08ad-40c8-a500-52f77b1244a7","resolution":{"observed_at":"2026-08-10T22:44:30.198608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.788712Z","title":"Integer or Floating Point? New Outlooks for Low-Bit Quantization on Large Language Models","venue":null,"work_id":"e7e7493f-850f-4611-926c-92962ce3a936","year":2024},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.203582Z"},"links":{"citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:7c8bb0f2dc0853321717f2670e55f6ee02cad3ea13eb528b18b1bf09fa6f9dc2","observation_id":"08012266-ae3c-495e-b919-96016dba2b7f","resolution":{"observed_at":"2026-08-10T22:44:30.792866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.775264Z","title":"BlockDialect quantizes matrices and vectors along their respective multiplication dimensions","venue":null,"work_id":"e18f3b21-550e-4928-bb2f-24e977da7eff","year":2023},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.207612Z"},"links":{"citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:1f47fa0d31f2236e15c9bfaa1f64ef1683b0e43dcfe51dd3aace61ec3bafe6a3","observation_id":"1a341f18-8111-494f-8508-5b9ca07d02e4","resolution":{"observed_at":"2026-08-10T22:44:30.779589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.762176Z","title":"These approaches often dequantize data to FP16 before performing multiplications, which limits computational efficiency","venue":null,"work_id":"8b9f0285-e554-4ecd-9416-702422d89bdd","year":2024},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.211562Z"},"links":{"citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:430eedd2b817a703fc85566e071c05745edb6b3d304909c332059a9e4df3195a","observation_id":"bc91eacd-7966-4cd4-9cd6-af15ba681bde","resolution":{"observed_at":"2026-08-10T22:44:30.766708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.748205Z","title":null,"venue":null,"work_id":"b031ddc9-d39a-485f-9e2d-8e45c85f1665","year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.215113Z"},"links":{"citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:5e55bcf481d2fd4bf92e0eb7325c631ebeef7efdf9429d9f753a6bcb9f74377f","observation_id":"291a412a-29bd-46d2-bdf7-84eb21efe9df","resolution":{"observed_at":"2026-08-10T22:44:30.752293Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.6268","last_updated":"2015-11-19T15:00:56Z","snapshot_observed_at":"2026-07-06T04:01:23.679812Z","submitted_at":"2014-11-23T17:03:51Z","title":"Infinitesimal generators for a class of polynomial processes","version":2},"cited_work":{"arxiv_id":"1411.6268","doi":null,"metadata_source":"pith","pith_arxiv_id":"1411.6268","snapshot_observed_at":"2026-08-10T22:44:30.254449Z","title":"Infinitesimal generators for a class of polynomial processes","venue":"math.PR","work_id":"d400e0dd-a3e9-4dce-a1af-4ebfe77bbd0c","year":2014},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.218614Z"},"links":{"cited_paper":"/paper/1411.6268","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:236d5d86d3eee6d22fdc5628cdda1327b076e92f35831f4861f0a8291fd1589e","observation_id":"fe82128d-1d2a-4c50-8bde-56c642954bb2","resolution":{"observed_at":"2026-08-10T22:44:30.261174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:44:30.735560Z","title":"However, 2D block quantization generally results in higher perplexity","venue":null,"work_id":"2cc41c57-f817-4c69-9a48-f579ef5a9b1d","year":2023},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.222315Z"},"links":{"citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:5ba4512041c1bc9b42a4aac53e0c9e9202fe603b40620895c0a8ae86755cb559","observation_id":"0666a55e-aba5-4c73-a525-14dc7910b484","resolution":{"observed_at":"2026-08-10T22:44:30.739617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-10T23:14:34.195361Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-10T22:44:30.152331Z","title":"N., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern´andez, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.152331Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:788e4ed6f420a0380652834c17395885aa394b616835eda1e805aa4b17f8e84f","observation_id":"56011b9a-eab4-4f73-8e41-f7b303c754cc","resolution":{"observed_at":"2026-08-10T22:44:30.152331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09782","last_updated":"2023-07-20T18:47:20Z","snapshot_observed_at":"2026-07-06T15:55:45.131112Z","submitted_at":"2023-07-19T06:58:03Z","title":"ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quantization Using Floating-Point Formats","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09782","snapshot_observed_at":"2026-08-10T22:44:30.184926Z","title":"ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quanti- zation Using Floating-Point Formats","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.184926Z"},"links":{"cited_paper":"/paper/2307.09782","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:d5e329884b6dceb48bab3a173b4b79e468211f3a604a56cb5a50ef8c3bf8d126","observation_id":"36f44717-6eb3-46df-80a9-6fa3c8c7ed8b","resolution":{"observed_at":"2026-08-10T22:44:30.184926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T22:44:30.081186Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Chal- lenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.081186Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:23c9f1c2adc3ffd4aeb892901d9a1ba00ad39be1cd13a029b9bd5603977c53c1","observation_id":"b4009a59-93ff-46a6-a113-6d43629015c9","resolution":{"observed_at":"2026-08-10T22:44:30.081186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-10T22:44:30.120356Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.120356Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:698fa364ac520434af3597652be1d8844af0306a179eff1843305c53ec7c1711","observation_id":"e256fefb-690f-4ec1-9063-af310016def5","resolution":{"observed_at":"2026-08-10T22:44:30.120356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-08T23:08:43.190961Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-10T22:44:30.086096Z","title":"SpQR: A Sparse-Quantized Representa- tion for Near-Lossless LLM Weight Compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.086096Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:1fc843ea5a510feb77d375c6e68e6cb1831a6b17f8d2cc5e2c8ca3f8cad9115e","observation_id":"ba4d08ae-e315-4153-882f-88fc32a473a4","resolution":{"observed_at":"2026-08-10T22:44:30.086096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-09T17:23:32.399243Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-10T22:44:30.071130Z","title":"L., Li, B., Cameron, P., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.071130Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:bad458319712e3b4387ba43b41a1e5732f811fab35354bdac06bfed68f858e4a","observation_id":"c86a6e86-becd-4432-97fa-457a4d37d62f","resolution":{"observed_at":"2026-08-10T22:44:30.071130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09259","last_updated":"2023-11-02T14:26:57Z","snapshot_observed_at":"2026-08-10T08:03:47.753476Z","submitted_at":"2023-10-13T17:15:05Z","title":"QUIK: Towards End-to-End 4-Bit Inference on Generative Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09259","snapshot_observed_at":"2026-08-10T22:44:30.065512Z","title":"Towards End-to-end 4-Bit Inference on Generative Large Language Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.065512Z"},"links":{"cited_paper":"/paper/2310.09259","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:418f783ff41ecdf1c8dc34b037460f139e5d5a3020040973ad8b056c348e16bf","observation_id":"46e991ba-1024-466c-94aa-34eb68889dd3","resolution":{"observed_at":"2026-08-10T22:44:30.065512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-10T22:44:30.111333Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-Trained Transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","version":5},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T22:44:30.111333Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2501.01144"},"observation_digest":"sha256:730a5a03df2a00b2de2367492b27c249c61c2af809a9032a12dd5458d00f2d00","observation_id":"cdbfc1e9-7671-4337-a652-aaff7238b9d6","resolution":{"observed_at":"2026-08-10T22:44:30.111333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01144","last_updated":"2025-07-24T03:46:03Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T06:22:20.267947Z","submitted_at":"2025-01-02T08:57:00Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2501.01144."}