{"as_of":"2026-08-16T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b9da56307eddd782f04600680f138143de8781174d217ece48d6cbaac584d7f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:54:30.919036Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03867/citation-record","integrity":"/paper/2608.03867/integrity","json":"/paper/2608.03867/citation-record.json","paper":"/paper/2608.03867"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.251417Z","title":"AMD Instinct™ MI350 Series GPUs,","venue":null,"work_id":"470d91a0-024c-4e88-a30d-9ed89d3d73da","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.061738Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:bba5a703032a0ffe94fce769da1255d192bcf8b9dfcc388f711ba84b80c7deb8","observation_id":"c9c12499-2e2b-41b5-a52a-a149e625ea0b","resolution":{"observed_at":"2026-08-05T10:54:32.254496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.242447Z","title":"System Card: Claude Opus 4 & Claude Sonnet 4,","venue":null,"work_id":"5530771b-d79c-4e74-824d-44bb74b6c2b5","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.148840Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:433a5cd9a0323930d737664a72b37d84d1221643bbc54284822f75c946c2fc78","observation_id":"38f6080c-a363-4330-adc0-61b81412f0f8","resolution":{"observed_at":"2026-08-05T10:54:32.245420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.233373Z","title":"QuaRot: outlier-free 4-bit inference in rotated llms,","venue":null,"work_id":"68a7bc42-6b1f-4965-b5ae-2cc0d6041019","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.229286Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:327b0c7021165d2eeba1bd038cad9b2e20bcc18eb82f32d00857c5439532f9ac","observation_id":"83a2abac-bb0c-4fd5-a249-0cb396aaaee0","resolution":{"observed_at":"2026-08-05T10:54:32.236474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.263418Z","title":"Cacti 7: New tools for interconnect exploration in innovative off-chip memories,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.263418Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9efd06bd40f983c4ffb80ad5254ee24f64a076eda593886b70d1c125c891ae53","observation_id":"949f57d1-a545-4f46-8424-af02b4034e2e","resolution":{"observed_at":"2026-08-05T10:54:28.263418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.224243Z","title":"Piqa: Reasoning about physical commonsense in natural language,","venue":null,"work_id":"eb950564-9a5b-46db-bb53-df6bdf928390","year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.329216Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:2f06665dd8b43cebb0da3b9512aec4b5d3e285c841442784b2a5e01a014c25cd","observation_id":"d98bff83-0c8f-406b-ba1f-0fbe50a22354","resolution":{"observed_at":"2026-08-05T10:54:32.227307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.401800Z","title":"Int v.s. fp: A comprehensive study of fine-grained low-bit quantization formats,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.401800Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:8f5a775017d844a5ee5ef5bb4f5ddde608491aa0cfbbbe7ac07b55e607aa2674","observation_id":"8fc5a00d-0a28-4996-9cd6-cc39ec0b7450","resolution":{"observed_at":"2026-08-05T10:54:28.401800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-05T10:54:28.471068Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.471068Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9a9871b738d8cf4cfc3acb71b5d43fa2a4f09b2a60ebc963f69b1c178728b548","observation_id":"5c2c8913-fb8f-4491-af78-b5ec33739032","resolution":{"observed_at":"2026-08-05T10:54:28.471068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T10:54:28.580769Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.580769Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:5a5b6d9e41488bd3b05361cec54f2db0b0578faf2aedaf9f60a11571ee4c27eb","observation_id":"48277872-e5ae-49e4-8e7e-4aab138abb8c","resolution":{"observed_at":"2026-08-05T10:54:28.580769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02010","last_updated":"2026-05-09T05:39:54Z","snapshot_observed_at":"2026-08-12T20:11:32.365290Z","submitted_at":"2025-12-01T18:59:45Z","title":"Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02010","snapshot_observed_at":"2026-08-05T10:54:28.676839Z","title":"Four over six: More accurate nvfp4 quantization with adaptive block scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.676839Z"},"links":{"cited_paper":"/paper/2512.02010","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:82d69c4c8ddc327ad2415226c7feb836fb45b881e0617f5c38c972627d0b9f7c","observation_id":"f9a7d5da-ac93-47c1-997c-294233991dce","resolution":{"observed_at":"2026-08-05T10:54:28.676839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.699322Z","title":"Efficient precision-scalable hardware for microscaling (mx) processing in robotics learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.699322Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ce6a602f99ff34b76fbeb6a38eeedca67d3a4aa549eed014fe689ae118721e50","observation_id":"a83d7654-d208-40e5-858c-cd7b06bc6112","resolution":{"observed_at":"2026-08-05T10:54:28.699322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.792184Z","title":"With shared microexponents, a little shifting goes a long way,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.792184Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ec3585c2a4ee97dcbd3ab472ed8ca27bd1e85272a524a47f262b997235809f21","observation_id":"d0573c81-314f-4b28-a94e-022414ad12b4","resolution":{"observed_at":"2026-08-05T10:54:28.792184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:28.907764Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:28.907764Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0b6888d2b67805ac068576919b995d9aa4aa8fa8e90df86cabfda554a6a15495","observation_id":"479b6f3c-623a-4d54-bc5a-2de962b1b321","resolution":{"observed_at":"2026-08-05T10:54:28.907764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.208690Z","title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale,","venue":null,"work_id":"ddcaad44-3bbe-4df3-b051-2a24b3511ba7","year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.005235Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:f102a000199225e0b1c0906329d5ffef95da488f1e771ad7b6b446e098a57c65","observation_id":"b762538d-8fec-4633-999c-c990af96b4c5","resolution":{"observed_at":"2026-08-05T10:54:32.212025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-16T15:26:27.063395Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-05T10:54:29.065972Z","title":"Spqr: A sparse- quantized representation for near-lossless llm weight compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.065972Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:bf1fb1aa93d65c19cc141668e57fae0faa666fb8ab978c34a70e8f7c2af4ea75","observation_id":"0d52327e-a994-4712-a432-e8aace3f64cc","resolution":{"observed_at":"2026-08-05T10:54:29.065972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.199719Z","title":"Extreme compression of large language models via additive quantization,","venue":null,"work_id":"4ea43baf-9241-486f-b8a7-9c9ca582e208","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.143132Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:78186478eaf70cbc9acdcae698cd9e1a45f3448403987b9e74e709f9992f99c6","observation_id":"b83e9f0c-927d-4c3f-8660-7c00c0204d1c","resolution":{"observed_at":"2026-08-05T10:54:32.202728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T10:54:29.303924Z","title":"GPTQ: Accurate post-training compression for generative pretrained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.303924Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:adbcde15924c2033a70d9ced2553a479fc471d2957f427e9cb61364c91205a1e","observation_id":"35899f3b-85b2-4c86-97ea-076263ccede1","resolution":{"observed_at":"2026-08-05T10:54:29.303924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:29.417903Z","title":"The language model evaluation harness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.417903Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:fe127917ed338b174006d95abe2112c3149f6e664aed2b463bfd8f8e1728d9ce","observation_id":"cf638634-a821-4b27-9813-0eabcd400783","resolution":{"observed_at":"2026-08-05T10:54:29.417903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.191013Z","title":"Gemma 4 Model Overview,","venue":null,"work_id":"a0d60c5a-ef32-44b5-845d-24db28368eaa","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.550359Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4f397f82d7bc9febafbe18fa68b66d04bb2fd25a8be3c9f28a6fa890905a4a61","observation_id":"2a8c3788-d6d7-416c-a0aa-37bb6bd0f321","resolution":{"observed_at":"2026-08-05T10:54:32.193835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.181668Z","title":"ANT: Exploiting adaptive numerical data type for low-bit deep neural network quantization,","venue":null,"work_id":"5fe0c023-2b17-4e86-8cd3-3b77ed023a86","year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.637719Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:35d6a99fe628498aff276d9962fc1997b4cf52474fceea9d3cc7c51f52d55f27","observation_id":"e7b05792-47c7-4ea6-b42d-3ec3fdfafa03","resolution":{"observed_at":"2026-08-05T10:54:32.184673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:29.770682Z","title":"BBAL: A bidirectional block floating point-based quantisation accelerator for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.770682Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:54f8635311ee1b3babe758c09b4470fd4271e257f8a30d6959a243785c4e846d","observation_id":"8029f34d-20a4-4469-bd82-df0ecdd958b5","resolution":{"observed_at":"2026-08-05T10:54:29.770682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T10:54:29.896018Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:29.896018Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:241bdafdafd7c57f666157da47e7231d53a7b7626a5bd1cdc728eb17878f9bc9","observation_id":"125c4c63-2891-4ec1-a961-9cf9aef6f499","resolution":{"observed_at":"2026-08-05T10:54:29.896018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.016464Z","title":"1.1 computing’s energy problem (and what we can do about it),","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.016464Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:f565dd364ded45074e9eddb5e0ca249a79c32831e1fa1a927ad0f8c8bbbbf7b7","observation_id":"d5f515fe-86d0-4f6a-870e-042bcc1a7de5","resolution":{"observed_at":"2026-08-05T10:54:30.016464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T10:54:30.113712Z","title":"Ruler: What’s the real context size of your long- context language models?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.113712Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:5c0fbc684976fc0f0ddc8c62ae2a9183f0abad6560e7d16e25ef4f5bd576455c","observation_id":"17875c65-6793-40a3-bcbd-cb21bf5e4199","resolution":{"observed_at":"2026-08-05T10:54:30.113712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.165707Z","title":"M-ANT: Efficient low-bit group quantization for llms via mathematically adaptive numerical type,","venue":null,"work_id":"719830a4-b6a2-461d-b30b-1e259fce5ff5","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.264778Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:59d909b930f3029cf6b5a981a42fd20c685ecc6d89880b079b560393068f0e4f","observation_id":"4770c4e1-84c9-40a2-820f-f86281e27bae","resolution":{"observed_at":"2026-08-05T10:54:32.169110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.375670Z","title":"M2XFP: A metadata-augmented microscaling data format for efficient low-bit quantization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.375670Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:490cfd0bb5c789f4a65b664cd4898dcbe980bac665e93498e02ccd94b9d91fcf","observation_id":"8a9df075-b593-4db8-b489-565517638e7b","resolution":{"observed_at":"2026-08-05T10:54:30.375670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.154971Z","title":"Blockdialect: block-wise fine-grained mixed format quantization for energy-efficient llm inference,","venue":null,"work_id":"98c67522-86d4-4c85-89f1-0ac06e42d201","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.535766Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d2cf05d8dcfa5dfc0dd41beef67417b4d63581f7833724ed6bd24e34dd092845","observation_id":"3c1f572b-6924-49b8-b55a-265e253bf2fd","resolution":{"observed_at":"2026-08-05T10:54:32.158601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.144517Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":"0ae251a1-c328-48c7-99fe-9b09cf43042e","year":2016},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.700003Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:7ce9366538ad5facb14856de689e4cdf86715a90f6f9c607512f15b79ff61c1f","observation_id":"1942b81a-3f95-47fc-ac60-9edbe07e590e","resolution":{"observed_at":"2026-08-05T10:54:32.147849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.134411Z","title":"14.2 a 16nm 216kb, 188.4tops/w and 133.5tflops/w microscaling multi- mode gain-cell cim macro edge-ai devices,","venue":null,"work_id":"1493b71b-7ab1-41ed-8ec5-ebca0a6a32a5","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.799634Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:8a979af1ad0e0a956f0e6c88cd493332e9fd28957d9130c447a9e545a885c1db","observation_id":"5fb49d37-4664-4019-8491-513e06c21bb3","resolution":{"observed_at":"2026-08-05T10:54:32.138096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.124443Z","title":"SqueezeLLM: dense-and-sparse quantiza- tion,","venue":null,"work_id":"afd0c63b-7e94-4704-a511-11ded97a5ba0","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.802603Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:31669b1faa20234444bf9fe209caba504c30c5f6169a60713511a4ba986ed595","observation_id":"9293ecb2-7281-40f4-9ea4-f69183e2d117","resolution":{"observed_at":"2026-08-05T10:54:32.127987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.114925Z","title":"Tender: Accelerating large language models via tensor decomposition and runtime requantization,","venue":null,"work_id":"0888a680-abce-4aa4-9a10-e84b42af2e59","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.805468Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9c4478354436e1f06833d75b1cbf1daefd27c53e1137caac34974868ddbd5c60","observation_id":"1f446c27-ee3b-44c2-b0aa-87ce14dce278","resolution":{"observed_at":"2026-08-05T10:54:32.118081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.808079Z","title":"MX+: Pushing the limits of microscaling formats for efficient large language model serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.808079Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:7f7272a2a5cee68635042a559edd1e2956e0744d46a2afca95d2f39a23025dd4","observation_id":"68b802df-f590-4a37-8d47-e15787d70166","resolution":{"observed_at":"2026-08-05T10:54:30.808079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.810712Z","title":"AWQ: Activation-aware weight quantization for on-device llm compression and acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.810712Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:7f6e97f7f89f5194db08897ab6f9da3b9c9ea454c49463d3e6b737ed3809df25","observation_id":"9b42c4bc-c813-4322-9aeb-87e3d7147472","resolution":{"observed_at":"2026-08-05T10:54:30.810712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.813720Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.813720Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9814f1ad560be6701f3db80ff2a9265596e10e17988bc6c521202a461fb4d421","observation_id":"7d175522-191d-485b-864f-3e336d846344","resolution":{"observed_at":"2026-08-05T10:54:30.813720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19821","last_updated":"2024-12-15T22:18:20Z","snapshot_observed_at":"2026-08-15T11:11:55.656459Z","submitted_at":"2024-12-15T22:18:20Z","title":"Nanoscaling Floating-Point (NxFP): NanoMantissa, Adaptive Microexponents, and Code Recycling for Direct-Cast Compression of Large Language Models","version":1},"cited_work":{"arxiv_id":"2412.19821","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19821","snapshot_observed_at":"2026-08-05T10:54:31.239932Z","title":"Nanoscaling Floating-Point (NxFP): NanoMantissa, Adaptive Microexponents, and Code Recycling for Direct-Cast Compression of Large Language Models","venue":"cs.AR","work_id":"7550d691-3612-4b78-a183-14f645f9ab0b","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.816676Z"},"links":{"cited_paper":"/paper/2412.19821","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:2b05863872e96b916331be858dcf971c398afe727095c5045b9c9e55e3d0c37c","observation_id":"fe303a0a-7967-48ef-bba0-6916b10b4dd8","resolution":{"observed_at":"2026-08-05T10:54:31.243463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.820251Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.820251Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:46dbfe584158f8930360b2f08fddb3ad1473f1e6e1baa9e73ba9f636d4ade041","observation_id":"da2dd973-057b-4547-84f8-d408236063a4","resolution":{"observed_at":"2026-08-05T10:54:30.820251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.093079Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":"5825a4e7-b655-49b0-904f-4d1c0a079869","year":2017},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.823013Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:6d36cd23b75aa325708cbb1164db2a080300ac546ff7d299df024ccdea62160b","observation_id":"dbf06264-3899-4c5b-ba41-699d6a484938","resolution":{"observed_at":"2026-08-05T10:54:32.095906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T10:54:30.825891Z","title":"The Llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.825891Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4244ca2606e53e9b4b541808d8235ace0d2d674cfbab92449a37be8823826eb2","observation_id":"ce95d21e-1406-4669-98a4-0523f4c90fca","resolution":{"observed_at":"2026-08-05T10:54:30.825891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.083442Z","title":"Four MTIA Chips in Two Years: Scaling AI Experi- ences for Billions,","venue":null,"work_id":"79752b4f-ba82-4cf8-b694-b9b905dd3e11","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.828823Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:b604eef696c1b8c6a60d33b6d630f31f50d644004f3aa045c151a14039175117","observation_id":"28354834-da05-47a8-a1f2-f1e269bb85d5","resolution":{"observed_at":"2026-08-05T10:54:32.086557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-13T17:08:54.114895Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-05T10:54:30.832174Z","title":"Recipes for pre- training llms with mxfp8,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.832174Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:544f9c522770fb2919746956c2fee1837973a337001aa32724ddc1d740c82473","observation_id":"4524645d-eafa-4379-bd0b-c0b96d1facf0","resolution":{"observed_at":"2026-08-05T10:54:30.832174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.074123Z","title":"NVIDIA H100 Tensor Core GPU Datasheet,","venue":null,"work_id":"5988bbd6-9a03-43f8-97c2-894bd5166084","year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.835513Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ccd51bbd8a1d35d7d8a2b6027f7a1d20d64e2aaedd5253ca7c82545020412b1f","observation_id":"89dd0de1-3794-4a65-81dd-6b76de128c2f","resolution":{"observed_at":"2026-08-05T10:54:32.077146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.055140Z","title":"NVIDIA Blackwell Architecture Technical Brief,","venue":null,"work_id":"b1e2f860-6ab2-47a3-8c4c-b56f25ee54d8","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.841679Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:fbf2d955ca6df841b75604dda09fdcc9ae54867211d1d43185734ad9a75a0a53","observation_id":"ede43b36-648a-4bc5-8422-66a65e77d04c","resolution":{"observed_at":"2026-08-05T10:54:32.058539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.044977Z","title":"OCP Microscaling Formats (MX) Specification,","venue":null,"work_id":"138875a2-315b-40f0-af86-4112f0df5c6e","year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.844766Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d54c2e8893fe9b23ba62e5ef54ac8778d5282543884c35836e7dbad4c6db5e82","observation_id":"c378b2c6-7f03-425e-8096-0634641038ae","resolution":{"observed_at":"2026-08-05T10:54:32.048394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.034380Z","title":"OpenAI GPT-5 System Card,","venue":null,"work_id":"716beac0-e890-4ac2-8196-63e25f0f6910","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.847687Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:fb1ad62fd646ca075a3783508fffdeb3d0abd5f088e36f1a158bda2bbc07be44","observation_id":"96f60da0-4c40-4a88-a26d-c01fe9b2c159","resolution":{"observed_at":"2026-08-05T10:54:32.037525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.850566Z","title":"Paszke, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.850566Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:770b0fb9cc440e6a6b5f1e90b661c248489114cfb27084c1218911dab051ff6c","observation_id":"9235f464-15d1-4964-82b4-eab6716076e7","resolution":{"observed_at":"2026-08-05T10:54:30.850566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.016253Z","title":"Scale-sim v3: A modular cycle-accurate systolic accelerator simulator for end-to-end system analysis,","venue":null,"work_id":"10c5bf2c-6e78-49d8-a0b1-72d40ea99e7b","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.853377Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:4754a5552521727272bd2fe9e63474c03e13b5f6a51a158315babafbaa02c471","observation_id":"026e5800-ad1d-4268-b9f8-e02e0ec0b35a","resolution":{"observed_at":"2026-08-05T10:54:32.019795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5053.37309","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.207008Z","title":"Microscopiq: Accelerating foundational models through outlier-aware microscaling quantization,","venue":null,"work_id":"32b36db8-2539-4e16-acf4-6fdf7746edce","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.856127Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:6d4a4ae0d3cc187cb5c0dc8a3d7e985daa3d56d94ab106210160507a1129abba","observation_id":"6faf28f5-d8e9-49bf-8d03-f2d1878ab052","resolution":{"observed_at":"2026-08-05T10:54:31.211877Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T10:54:30.858903Z","title":"Gemma 2: Improving open language models at a practical size,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.858903Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:2b53da08e18b9c2dda1efbadf44791817375e91494e1578fa80cfcba9efd8436","observation_id":"988dd783-6710-4168-9800-8fa23fba956c","resolution":{"observed_at":"2026-08-05T10:54:30.858903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.005525Z","title":"Pushing the limits of narrow precision inferencing at cloud scale with microsoft floating point,","venue":null,"work_id":"074e1fab-42da-40e1-8161-6d52a3dcbbfd","year":2020},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.862614Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:e79271acbe711bfe00398a4fc9069a83403ac9c4e7982235ef6880404172b069","observation_id":"0d5b7539-4204-4fde-a6af-5cf1f3177c2b","resolution":{"observed_at":"2026-08-05T10:54:32.008859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-16T14:51:41.930241Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-05T10:54:30.865642Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.865642Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:87f4ad2a9e714a2913b0dfe5619b045e5bd04bd291e6b9d278636ad205a9e5f2","observation_id":"f8149f9c-a0c1-4b1e-84be-2c3e9c5b26d4","resolution":{"observed_at":"2026-08-05T10:54:30.865642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.869033Z","title":"Winogrande: an adversarial winograd schema challenge at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.869033Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:e5b9a5150176130ea1e98b65487dd667cd0d750d805e5e3560a29a5faa6a3d27","observation_id":"d1b68ba9-8e7e-4d30-9af9-23f8051ab664","resolution":{"observed_at":"2026-08-05T10:54:30.869033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-16T15:05:54.961547Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-05T10:54:30.872438Z","title":"Omniquant: Omnidirectionally calibrated quan- tization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.872438Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:ebe4730fea96190cbdb3948b9117fe1e2a3e324afff18e3939e46cd806a405d9","observation_id":"3c3f1d7f-18c7-44ab-b77e-62787b4c2eaa","resolution":{"observed_at":"2026-08-05T10:54:30.872438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.994820Z","title":"Towards vqa models that can read,","venue":null,"work_id":"e47865d4-6fc3-4e84-af03-4071809f83d2","year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.876298Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:82d67c430526435b4e8d2cfaab27aec31f607621fe5eab645c86480a95a1686e","observation_id":"c817380b-ca78-47b7-a649-d41cb3bb13ef","resolution":{"observed_at":"2026-08-05T10:54:31.998117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.984538Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge,","venue":null,"work_id":"6cc20448-9d0c-4cd8-b6a2-ef633e806c7a","year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.879465Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:744362387acd99011a705c667b9d0c5f196ae76249126d54149245d9983fc828","observation_id":"ea0eed34-34b1-4b9b-b1c9-15b74de6e25a","resolution":{"observed_at":"2026-08-05T10:54:31.988088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.973979Z","title":"A microscaling multi-mode gain-cell computing-in- memory macro for advanced ai edge device,","venue":null,"work_id":"6dade61b-3e63-4c80-ae21-392d9d976de5","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.885660Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0de0baa77d3b09bf92cd73caf0e75cf013874a4d4e3a0afc80792d9a7eb874a3","observation_id":"92f0e344-78fd-40aa-ac6a-384dabf9c983","resolution":{"observed_at":"2026-08-05T10:54:31.977638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.963075Z","title":"Quip#: Even better llm quantization with hadamard incoherence and lattice codebooks,","venue":null,"work_id":"46720f8f-d654-4f38-9de5-fe8b1d9e76b1","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.888361Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:a165df3b93e70bcae0b9c04d44c0f7f52e5d767f911a475df610ed0e3a7de87b","observation_id":"0f9c46a0-8a74-49b2-ad29-c854ada80fd8","resolution":{"observed_at":"2026-08-05T10:54:31.966233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.953245Z","title":"30.1 a 28nm 127.54tflops/w mxfp6 and 117.42tflops/w mxfp8 compute-in-memory macro with adaptive- preserved-bit-width and serial-dual-bit-sliding schemes,","venue":null,"work_id":"eb232c40-143c-4a1e-af2a-fddb05199126","year":2026},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.890967Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:1735b94c1da4fca38a0492ac578c2b145f2bdc20ca385e92cec08f2a0eb07903","observation_id":"c8c0dbc9-5fda-4415-a49b-b34e1914798e","resolution":{"observed_at":"2026-08-05T10:54:31.956423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.894125Z","title":"Accelergy: An architecture- level energy estimation methodology for accelerator designs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.894125Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:9ae9fe0a5a134e9058ca6be166205e3332e0455808eb8c619af54b5936d24eb7","observation_id":"e41a0196-9109-443b-97d9-14fa97783159","resolution":{"observed_at":"2026-08-05T10:54:30.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.936373Z","title":"SmoothQuant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"d7c20f69-ed08-4e8e-9019-9504f6b36284","year":2023},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.896961Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:e1859cb62a7c85dc869420aedaffe40f9ff3ecec32a4dc5fdd62ed871d61b169","observation_id":"63e2bea2-e0a6-42cc-b28d-a2181327298e","resolution":{"observed_at":"2026-08-05T10:54:31.939793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"custom-ai-accelerat/4229118","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.088200Z","title":"Inside Maia 100: Revolutionizing AI Workloads with Microsoft’s Custom AI Accelerator,","venue":null,"work_id":"81a5ef3f-a0e9-4f0e-ad4a-04c7d611f766","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.899617Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:8759ebf97b09c4d1c17eaba9cfef152eaed7e01503ca08ccdbbcd6deebaa9c57","observation_id":"14e1b5ac-698f-466e-81f7-f6a81c81dbbc","resolution":{"observed_at":"2026-08-05T10:54:31.096960Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.925472Z","title":"An empirical study of microscaling formats for low-precision llm training,","venue":null,"work_id":"f6d2d92c-5080-426d-90ad-f7fb47127f59","year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.902228Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d177aa2a278c7de5877a6dab004228851cd65438baf63b560730f618fa6b16c0","observation_id":"ce701b2b-ff15-4e2e-ac69-3e6a1a2eefa3","resolution":{"observed_at":"2026-08-05T10:54:31.928622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T10:54:30.904865Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.904865Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:1c800afb13f1d2dba1e1b6a7e2fd60d2159858b34f99f9ab059ac025a7cf25f6","observation_id":"a94af574-4fab-41b3-be30-29247e664c8b","resolution":{"observed_at":"2026-08-05T10:54:30.904865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.915913Z","title":"ZeroQuant: efficient and affordable post-training quantization for large- scale transformers,","venue":null,"work_id":"6607a765-93aa-4519-ad0f-624f16b4ead7","year":2022},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.907783Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:7e8ab29fff3ebccb7bba23354ce710108a2268d52c9b430ccd960f994026aa0a","observation_id":"e4480135-ffae-484b-a485-d5b94840eeef","resolution":{"observed_at":"2026-08-05T10:54:31.919045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.905713Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"a225cb72-0ba6-4e18-96c9-2b5dc57a4da6","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.910696Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:0d6368d900780f57d17df87b7e3ce29d9d19d0e2e36ffedf7eb403358938ce7c","observation_id":"c371b86c-9450-4eaa-aa06-56caf514d875","resolution":{"observed_at":"2026-08-05T10:54:31.909352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.896194Z","title":"Hellaswag: Can a machine really finish your sentence?","venue":null,"work_id":"9247d8bf-22bc-40d5-bff9-27f5fabf4d55","year":2019},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.913180Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:122a0ebd24ccfce15142396415faf2877d4b199f5f962ce28d0e8af5584d5a85","observation_id":"a5732eb2-2ab1-4f99-a65c-9ab9668675d8","resolution":{"observed_at":"2026-08-05T10:54:31.899313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:30.916143Z","title":"Sageattention3: Microscaling fp4 attention for inference and an exploration of 8-bit training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.916143Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:a9a97958680b5591a0326ebcf57647c66a079d6ea32ddee6976c8cd8b976ee9a","observation_id":"2fedea90-72f7-44d1-b563-6394105f8d4b","resolution":{"observed_at":"2026-08-05T10:54:30.916143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:31.886063Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"047e2aa0-dc5f-47b1-8bef-f5ef7f4bf538","year":2024},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.919036Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:d3ca2a730dff387c4a3ed3f3be46a7fa2401c1da6fc7ee8f21fbb4da9e8e8f3c","observation_id":"e0425dbc-440e-4ee4-84bc-020d68b61a3d","resolution":{"observed_at":"2026-08-05T10:54:31.889954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-14T18:05:06.623407Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-05T10:54:30.882544Z","title":"Available: https://arxiv.org/abs/1811.00937","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.882544Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:f934780cd27a3038126e8422ec9df668402e0bc5df7916281fd875833c4bb5f0","observation_id":"ebe5e4cd-69d1-4586-a98f-f71b09d188b4","resolution":{"observed_at":"2026-08-05T10:54:30.882544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:54:32.064757Z","title":"Available: https://resources.nvidia.com/en-us-gpu- resources/h100-datasheet-24306","venue":null,"work_id":"7da5b304-3121-4ec7-bad9-1a47c78a24f1","year":null},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.838691Z"},"links":{"citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:a44de249288e3a256da3028899ba111ada31b17e00ce782bf3ffd3e117ac06c1","observation_id":"2d2a2b2c-93a8-4238-84da-dbd2ecbd8d5d","resolution":{"observed_at":"2026-08-05T10:54:32.068016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-16T07:29:02.618654Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.03867."}