{"as_of":"2026-08-10T08:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7732442ad5aca22404ddaf1830992c940a8690e913e75212e5e32c5b229b6588","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:37:52.831949Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:06:32.220604Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:06:44.760367Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"cited_work":{"arxiv_id":"2506.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07533","snapshot_observed_at":"2026-07-02T07:06:44.760367Z","title":"arXiv preprint arXiv:2506.07533 , year=","venue":null,"work_id":"4642aba2-b17a-4149-9018-27eab88f3bd5","year":2025},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-02T18:57:31.493788Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2506.07533","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:724693deebe98731e70970e05d64dffb2cce2925dced31363d651ce9285998fa","observation_id":"f73211dc-0b3b-4b67-9f8b-08170c1576cf","resolution":{"observed_at":"2026-05-18T12:41:22.811448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"cited_work":{"arxiv_id":"2506.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07533","snapshot_observed_at":"2026-07-02T07:06:44.760367Z","title":"arXiv preprint arXiv:2506.07533 , year=","venue":null,"work_id":"4642aba2-b17a-4149-9018-27eab88f3bd5","year":2025},"citing_paper":{"arxiv_id":"2604.19167","last_updated":"2026-04-21T07:25:02Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T07:25:02Z","title":"LBLLM: Lightweight Binarization of Large Language Models via Three-Stage Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-10T03:04:14.900791Z"},"links":{"cited_paper":"/paper/2506.07533","citing_paper":"/paper/2604.19167"},"observation_digest":"sha256:d898b02b3103a89f9885fa917595d7b5abe4afb4340688f51a9e5ec0e98da0bc","observation_id":"f42a5624-500e-456e-945c-895ae92cf14b","resolution":{"observed_at":"2026-05-11T12:46:04.826877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"cited_work":{"arxiv_id":"2506.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07533","snapshot_observed_at":"2026-07-02T07:06:44.760367Z","title":"arXiv preprint arXiv:2506.07533 , year=","venue":null,"work_id":"4642aba2-b17a-4149-9018-27eab88f3bd5","year":2025},"citing_paper":{"arxiv_id":"2606.04980","last_updated":"2026-06-03T15:03:18Z","snapshot_observed_at":"2026-07-06T23:45:02.342193Z","submitted_at":"2026-06-03T15:03:18Z","title":"AlphaQ: Calibration-Free Bit Allocation for Mixture-of-Experts Quantization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T07:06:32.220604Z"},"links":{"cited_paper":"/paper/2506.07533","citing_paper":"/paper/2606.04980"},"observation_digest":"sha256:6ef2a1f464260109000335cf55188367b08baac156dfe48eff3dc159a2e4ca32","observation_id":"3319422f-3338-450e-8a37-083fda5a5ae0","resolution":{"observed_at":"2026-07-02T07:06:44.762157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07533/citation-record","integrity":"/paper/2506.07533/integrity","json":"/paper/2506.07533/citation-record.json","paper":"/paper/2506.07533"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.098701Z","title":null,"venue":null,"work_id":"aa6a2ce1-27ba-4a7f-89e0-bda1af07c285","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.726359Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:1afdb29f07933e8888757edd3b00b46cb2463d948bca73af8d6fbb2cb3858dcf","observation_id":"93ef760f-9fe2-455e-bfb2-7cc69503ccb0","resolution":{"observed_at":"2026-08-07T05:37:53.101344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.091356Z","title":null,"venue":null,"work_id":"5b8ca297-3965-4d4f-9bda-4a1b649601dc","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.729848Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:083877e55ba4d09b56b0d3e0ff9394ff60971feac7b62ef76b2cf495c852afc8","observation_id":"00c1b072-33df-4c31-8784-c606e5bad556","resolution":{"observed_at":"2026-08-07T05:37:53.093931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.083884Z","title":null,"venue":null,"work_id":"facf8ea9-ccb7-4fa7-bac3-de7411039eb0","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.732621Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:c231f1c3e11ffb1f0cc2124dcaec92534e0eb32f7b3e806c3497a5845411c324","observation_id":"cad4eba4-2e70-483a-86af-74d99a9302d8","resolution":{"observed_at":"2026-08-07T05:37:53.086525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.076625Z","title":null,"venue":null,"work_id":"cbe02cd0-b98e-4944-ab64-3142c87400e3","year":2022},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.736276Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:6816fc2094ee0025290864e9b5a4aeabd0b2fd0b95c4e616d9384542abda5d19","observation_id":"ff7b7b0d-b588-4130-bf45-8099c29fedc2","resolution":{"observed_at":"2026-08-07T05:37:53.079284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.739085Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.739085Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:5f9afa8d7cedf8ba9441d0a5ab73cc53f12b90aed885eff7de9c0036b9b43968","observation_id":"d0cc57ba-1a11-44bc-81c1-d6d6084505d2","resolution":{"observed_at":"2026-08-07T05:37:52.739085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:37:52.741766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.741766Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:2eb94bea5b25e51d32b0282208d49c1d50f16ba913d34343ae9f952ff1969597","observation_id":"9d270926-113e-4682-8a45-974699604732","resolution":{"observed_at":"2026-08-07T05:37:52.741766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.744828Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.744828Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:eeb6cb9bb68a9c6b9b5f18e736d94a584c0118f565a9551c6a749b79d3b76cbf","observation_id":"11cae4a9-7209-4517-a833-125d20dfee12","resolution":{"observed_at":"2026-08-07T05:37:52.744828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.062101Z","title":null,"venue":null,"work_id":"5fe36ec1-5694-451f-aed0-eb880e622036","year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.747319Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:ea3d041882c0306e77596b722b95b85731cc4114b8a22688a447de59cbbfdb32","observation_id":"58e4bff1-2dd4-414c-9faa-12c37e7358e2","resolution":{"observed_at":"2026-08-07T05:37:53.064517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.054690Z","title":null,"venue":null,"work_id":"ed455dbd-2c56-4f03-bc52-56854127442c","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.749750Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:c4e293d198939e47c069bf65f1521d121431e8b040030fddb53030ef982e4f5d","observation_id":"1a19405e-cd93-4e6e-a6cb-9cb971805fcc","resolution":{"observed_at":"2026-08-07T05:37:53.057502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.047079Z","title":null,"venue":null,"work_id":"d46ab316-d2cd-4a37-8edf-5ffe3f1f98e1","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.752293Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:1c4fd28b6d9fbe7cc78f76378d95cc16410203b1356c8e091ec0b852af224b6b","observation_id":"62b3619a-8255-4aad-a1c8-50cf07bc25a0","resolution":{"observed_at":"2026-08-07T05:37:53.049905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-09T07:19:27.126976Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-07T05:37:52.754758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.754758Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:32c163fbe05215092b7ff70f515c9b4f3d9f06c63177d4b598812e0783ee8442","observation_id":"1b096e79-904e-4e7a-9c35-dab5e3ecdf9f","resolution":{"observed_at":"2026-08-07T05:37:52.754758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.757583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.757583Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:ece09c1876a22753338cd147bac3ded8dd5f16dcfafed522b3d1ec00931de7e2","observation_id":"8eaa42d7-0799-46b7-b4f1-a8016b6bfc54","resolution":{"observed_at":"2026-08-07T05:37:52.757583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:37:52.759987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.759987Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:f3cd1bef3079dc605b8730394b55dcbc984f0aba3b1e72c65638d1f5726a9011","observation_id":"70738aa0-3e22-43c7-b94d-a7b9c39670f9","resolution":{"observed_at":"2026-08-07T05:37:52.759987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.035626Z","title":null,"venue":null,"work_id":"39187976-60ac-485a-b2d5-03168fc8bddd","year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.762469Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:613e1fff8d3c64ed1337e963b0f29f7d4382cdf95d825e446b8d40bf039670ff","observation_id":"2fa381d1-f621-471f-bd56-2dd8f5858f38","resolution":{"observed_at":"2026-08-07T05:37:53.038373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.028459Z","title":null,"venue":null,"work_id":"551b3fa8-be00-4d01-86b1-fa6d22b28172","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.764935Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:d5785fe82327024be8fc6a74f0b9968a5b4a02afc480828a74165e396263ffb4","observation_id":"33383077-b0d1-46c5-a5dc-d23f0f20442a","resolution":{"observed_at":"2026-08-07T05:37:53.031098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.767321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.767321Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:f16e4ce345a0f147bfb60afd4403092d0def6ed5f552f3ebc48b41f0aa7057a5","observation_id":"24978516-5df3-4c95-b05e-6100d9279c55","resolution":{"observed_at":"2026-08-07T05:37:52.767321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.017569Z","title":null,"venue":null,"work_id":"628c00b4-96a7-4ede-be89-e080ec643722","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.769657Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:54a3bb7b488d315dfbc68a02f525699b5a0fcfd8364cda9187716b7ca6969f49","observation_id":"471a6197-9f0c-4740-b8f7-e7daa127c0f8","resolution":{"observed_at":"2026-08-07T05:37:53.020173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.009174Z","title":null,"venue":null,"work_id":"a6ec4263-5f28-44b6-a778-81c56fca8e2a","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.772099Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:4392e822e96d5c52464624a0141a3385579e7cbd7bfaacca32cf7c87fda2b021","observation_id":"391055aa-87be-4d0e-a8ab-a3c80408998e","resolution":{"observed_at":"2026-08-07T05:37:53.011936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:53.001058Z","title":null,"venue":null,"work_id":"5718ddc4-5b9c-45d5-acee-a473e54cf612","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.774596Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:5247722dbc03dfa8d48fc415a35364ea0a27ec7540c42f818346d12f97887939","observation_id":"69fc9aba-5171-4328-8028-6c167f724b79","resolution":{"observed_at":"2026-08-07T05:37:53.004184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.993272Z","title":null,"venue":null,"work_id":"93879a9a-190c-4604-9783-d5a3bf5bad7d","year":2025},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.777238Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:f10c397d27a44e79230e6a516c0149a52a0f7b84b89358e5d717c51f31b81f1f","observation_id":"fbcfab01-79d6-4a7c-b889-80c989f83034","resolution":{"observed_at":"2026-08-07T05:37:52.996040Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.985734Z","title":null,"venue":null,"work_id":"08a769df-5f7a-4b5c-95da-f0b5abe5cf25","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.779700Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:a4a656b6ff941ab9710b89af9a12f1e8dd45bacfe60a57b6fa3aee02bd11bd8e","observation_id":"be14830c-359a-4c1a-89ec-ff7a6c519f25","resolution":{"observed_at":"2026-08-07T05:37:52.988534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.978214Z","title":null,"venue":null,"work_id":"3e7bfd79-fdc8-4c8c-bbc7-def50d1ad25f","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.782013Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:e6e88892f47fb3a86eb937a05898f63744aedc9b7774a8c3a6250f99d532e3f9","observation_id":"1ea7fddc-0f24-4453-93ed-d2c6a9d2e76f","resolution":{"observed_at":"2026-08-07T05:37:52.980782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.970896Z","title":null,"venue":null,"work_id":"6cb0cdb5-e118-4994-b309-e00cc84ba3ff","year":2017},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.784541Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:94c0f0063cab6585d2447b2affc10c8eb9bbf5f48540cf44293d8e7a9810d636","observation_id":"3c4f9fe3-4537-4d32-af70-8a79c5127e2f","resolution":{"observed_at":"2026-08-07T05:37:52.973484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01160","last_updated":"2023-06-01T21:33:59Z","snapshot_observed_at":"2026-08-10T03:50:20.888402Z","submitted_at":"2023-06-01T21:33:59Z","title":"Faster Causal Attention Over Large Sequences Through Sparse Flash Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01160","snapshot_observed_at":"2026-08-07T05:37:52.787126Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.787126Z"},"links":{"cited_paper":"/paper/2306.01160","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:5652459576fab48aa223622e078cea3283dbaf13729d8aeaf9f51f95c2684bb0","observation_id":"bbfdb19f-daaf-43af-b8c1-5dbaab7ca91b","resolution":{"observed_at":"2026-08-07T05:37:52.787126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.963238Z","title":null,"venue":null,"work_id":"fb146163-781a-4e87-815f-c07effb33b60","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.789767Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:dfd5acd43eeb8843a28031be8e6e143075e4e2451847b60e290372576a5967c0","observation_id":"f653f2a2-fb66-4252-9dde-b75c79ef059a","resolution":{"observed_at":"2026-08-07T05:37:52.965936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09504","last_updated":"2025-04-13T10:07:52Z","snapshot_observed_at":"2026-08-07T16:06:10.633744Z","submitted_at":"2025-04-13T10:07:52Z","title":"MADLLM: Multivariate Anomaly Detection via Pre-trained LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09504","snapshot_observed_at":"2026-08-07T05:37:52.792294Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.792294Z"},"links":{"cited_paper":"/paper/2504.09504","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:66fe2fbc52f35789d8885a2107e426dd823e5f359b8af17da471c100e2f4a768","observation_id":"193f9b5b-60dc-402d-9cac-c2b29da981d9","resolution":{"observed_at":"2026-08-07T05:37:52.792294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.955418Z","title":null,"venue":null,"work_id":"2522edd8-118a-4581-9d0b-d2d3030969d6","year":2025},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.795055Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:cb0d0b2fbf66d236391575fb273e089934809b089455405b26cfcac5367a3cdd","observation_id":"35f25e79-6c45-4749-a952-90cca57ef983","resolution":{"observed_at":"2026-08-07T05:37:52.958128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:37:52.797726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.797726Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:24d701a4550d7b141c2fa30e4dfb162b854e807c5c49440e746e5e426e3c04cb","observation_id":"300f7af0-503a-407a-8bd8-a0b576c0ad48","resolution":{"observed_at":"2026-08-07T05:37:52.797726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:37:52.800505Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.800505Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:d4bbee146782bb7d533f78d5bc6bc6009fab2f3acd396411e7539cc4a4f1a8fc","observation_id":"f99d2bfa-44fc-4718-9bcd-42802985e054","resolution":{"observed_at":"2026-08-07T05:37:52.800505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T05:37:52.803173Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.803173Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:44d24dd743c50f44ca63ac80bc0d60b654779c153227435951db3034ef797e83","observation_id":"80714b5a-a09a-423f-977f-ce829752f20b","resolution":{"observed_at":"2026-08-07T05:37:52.803173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.805537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.805537Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:4277bd466c8c09dbccd667abc0d9be7f9755c02e41bfb92308ad0bb7096b6f1c","observation_id":"8ec93e94-a880-4197-bd4c-a5ffe10393f7","resolution":{"observed_at":"2026-08-07T05:37:52.805537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-06T16:06:48.213787Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-07T05:37:52.808116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.808116Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:aa4cb83b967e4befdacb7e40045681501c9c95e740cd43ddfc1c3554d2fef1ca","observation_id":"feb5f522-870d-4ed0-a219-fdf23f4847e2","resolution":{"observed_at":"2026-08-07T05:37:52.808116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-07-06T17:36:40.933805Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-07T05:37:52.810890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.810890Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:c3e0af97d33b8d89d4b217723d3e979cdee3d4b789268b837a867faad56e303a","observation_id":"edbfd869-51d3-4373-a409-88549bb739b6","resolution":{"observed_at":"2026-08-07T05:37:52.810890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.813698Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.813698Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:e9bc82fe5c7916aac0e8f555a4474bdb3090e2c20df5620f30c5ade9fda9d92b","observation_id":"dabcf591-c317-44d8-805c-5be471d6d578","resolution":{"observed_at":"2026-08-07T05:37:52.813698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.940243Z","title":null,"venue":null,"work_id":"03d073cf-5388-46b1-9be0-a6c32a9c8d5e","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.816113Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:273e6a3f390f5412a1577f4e21edf07e9340349a09dacae778538a7c2c22872e","observation_id":"fb1188af-ed16-4d39-b644-994bcfb1a400","resolution":{"observed_at":"2026-08-07T05:37:52.942824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.933186Z","title":null,"venue":null,"work_id":"03dd5e08-f296-4b2b-993b-22bf1b0a0cae","year":2022},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.818713Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:ee67280ce719ea4732e9bd78723b91bf6dd4aff596212f5f45057eb6b95b1a92","observation_id":"2da58a12-dbd8-46a8-8a91-4fca6f72382b","resolution":{"observed_at":"2026-08-07T05:37:52.935733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.924281Z","title":null,"venue":null,"work_id":"238acfcd-a165-4b19-8349-dd316a811cee","year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.821094Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:55b554aeb3aacc72fc3c44c6b42402f3f4f3659579ebc63c597f506db4fc7340","observation_id":"d6ba924a-3ae2-4abe-8cfd-a5028b7e80e3","resolution":{"observed_at":"2026-08-07T05:37:52.927800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.824237Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.824237Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:61aa9928fa6f586f2430f849ee889d032bcd60ddbaddc636ce0de5a61c359cb0","observation_id":"ec05a50f-2d00-48a0-9a0a-d4c08bd40119","resolution":{"observed_at":"2026-08-07T05:37:52.824237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.826625Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.826625Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:8adbe4c171050199be2720c1ad0dd28ee66b20944bfdf958d586f04d061b7b36","observation_id":"5e5aa577-2ea5-4556-9901-5379ceb2738a","resolution":{"observed_at":"2026-08-07T05:37:52.826625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.829127Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.829127Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:102098c03c439b13b31f9d2073f65592521c6006e8d721463f6283829a350d69","observation_id":"87fac50a-0b1e-4fb8-a603-688c0dc16a9b","resolution":{"observed_at":"2026-08-07T05:37:52.829127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:37:52.831949Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:37:52.831949Z"},"links":{"citing_paper":"/paper/2506.07533"},"observation_digest":"sha256:679d2b60318d04ab0adc5d463d02207c6d07ad0c8a2674c3ccfa6960abec9556","observation_id":"874692fc-bb50-47bc-9e4e-424041ea12d6","resolution":{"observed_at":"2026-08-07T05:37:52.831949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07533","last_updated":"2025-06-09T08:16:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T03:01:45.918840Z","submitted_at":"2025-06-09T08:16:24Z","title":"MoQAE: Mixed-Precision Quantization for Long-Context LLM Inference via Mixture of Quantization-Aware Experts"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2506.07533."}