{"as_of":"2026-08-15T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17aef438d2d0c21dbda968546ce7ecc7d453b2b165401a8f9a6553b767b1bdc6","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:51:01.240091Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T12:38:31.783807Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T12:41:22.816856Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"cited_work":{"arxiv_id":"2509.01229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2509.01229","venue":null,"work_id":"61b433a6-3dd1-4142-8811-216734dd05bc","year":2025},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-11T15:59:00.787729Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2509.01229","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:461d41b23f91733e30a461a95c0bd36da8cb3bfb5b465feadaac9fff85cd2a78","observation_id":"70332ef3-f172-4b80-a889-757a0a393ff8","resolution":{"observed_at":"2026-05-18T12:41:22.819166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"cited_work":{"arxiv_id":"2509.01229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2509.01229","venue":null,"work_id":"61b433a6-3dd1-4142-8811-216734dd05bc","year":2025},"citing_paper":{"arxiv_id":"2605.13915","last_updated":"2026-05-13T09:49:56Z","snapshot_observed_at":"2026-08-14T16:52:11.220214Z","submitted_at":"2026-05-13T09:49:56Z","title":"Multi-Scale Dequant: Eliminating Dequantization Bottleneck via Activation Decomposition for Efficient LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T02:57:18.944617Z"},"links":{"cited_paper":"/paper/2509.01229","citing_paper":"/paper/2605.13915"},"observation_digest":"sha256:b29a9afd567a07a19f3638a43bf6c60c50e37c1854d6a810bd7e7034d76feef9","observation_id":"e57b1a6c-4eb1-4c46-aff3-a37ea38ccb25","resolution":{"observed_at":"2026-05-15T02:58:34.214757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01229/citation-record","integrity":"/paper/2509.01229/integrity","json":"/paper/2509.01229/citation-record.json","paper":"/paper/2509.01229"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.00456","last_updated":"2024-10-29T11:09:12Z","snapshot_observed_at":"2026-08-13T00:40:50.161960Z","submitted_at":"2024-03-30T19:20:06Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00456","snapshot_observed_at":"2026-08-05T12:50:58.727339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:58.727339Z"},"links":{"cited_paper":"/paper/2404.00456","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:8b044cc73d65bf0eb8706348e1f72e5e7c1d6da4b64a99f4aac989e776a7c561","observation_id":"33d69fc8-5ca4-482c-8991-68d8b707075c","resolution":{"observed_at":"2026-08-05T12:50:58.727339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.800246Z","title":null,"venue":null,"work_id":"d5312ebb-5e73-4208-a4ac-09f06181fbbf","year":2020},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:58.918382Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:39dd64536c5e7e0fad913c64258872315ff63adf911cd084856444c63f9f0f63","observation_id":"36a89caf-b328-4462-9615-5b9d20f67e4c","resolution":{"observed_at":"2026-08-05T12:51:01.804292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06385","last_updated":"2024-09-03T16:36:06Z","snapshot_observed_at":"2026-08-12T23:46:21.330363Z","submitted_at":"2024-06-10T15:44:22Z","title":"Low-Rank Quantization-Aware Training for LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06385","snapshot_observed_at":"2026-08-05T12:50:59.043745Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.043745Z"},"links":{"cited_paper":"/paper/2406.06385","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:2123ac03c34425611754e6c40bc045f9657e13d8221b19b0e3ee870afa9d8e46","observation_id":"866efa00-67b3-4e79-9ef7-4b994c45f1be","resolution":{"observed_at":"2026-08-05T12:50:59.043745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11062","last_updated":"2025-05-19T06:20:01Z","snapshot_observed_at":"2026-08-13T19:22:45.524352Z","submitted_at":"2024-07-10T17:53:30Z","title":"EfficientQAT: Efficient Quantization-Aware Training for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11062","snapshot_observed_at":"2026-08-05T12:50:59.236249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.236249Z"},"links":{"cited_paper":"/paper/2407.11062","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:44dc252f5e2469d3171a60d48dd45c264aad82b31af3ce17368a8123a2b1c8d4","observation_id":"4c4bb3cb-8bb4-4c7c-9d5e-ead0b2eef072","resolution":{"observed_at":"2026-08-05T12:50:59.236249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T12:50:59.329622Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.329622Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:defee710e081647fa01d873f456bc0bf3ab934e97f08543951105b845b24737b","observation_id":"cda9b768-4f76-48e3-9f42-ba2f16c6e77e","resolution":{"observed_at":"2026-08-05T12:50:59.329622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T12:50:59.389003Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.389003Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:fa403dd3e9f57376c09e5ed4794ff86204170f469c588d29978023bca9ffcd2e","observation_id":"f424dd9e-3948-4a54-9a70-5e333c78988d","resolution":{"observed_at":"2026-08-05T12:50:59.389003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.784296Z","title":null,"venue":null,"work_id":"7cc312ac-49a1-46e3-94aa-2f06a461fa2a","year":2022},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.491951Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:edda7001f8f6b2e2dcca8d7ab064f35f7035534eda08ec743bc4aeaab81d8ed9","observation_id":"ab9adc55-311a-4df8-b4e0-92636de41a5c","resolution":{"observed_at":"2026-08-05T12:51:01.790186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T12:50:59.565844Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.565844Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:0a39216652ac422104c18c86bab233baeaf852aa42ec6cb25aadb2820876b610","observation_id":"2b4168fd-093a-4644-a754-43deece68509","resolution":{"observed_at":"2026-08-05T12:50:59.565844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T12:50:59.639928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.639928Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:8f659ba51911747d06df0d78b99bd35effadd322ea775583673a0768d56795c9","observation_id":"26d02f9d-50c9-4cad-abeb-719682daf6ff","resolution":{"observed_at":"2026-08-05T12:50:59.639928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T12:50:59.710091Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.710091Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:d2eccaa519a6b30dfc12f1edabfd41b2a6cf8700d530ba58eae55f291a7374db","observation_id":"ab963050-78d5-4e73-b9b2-da5785f3f1da","resolution":{"observed_at":"2026-08-05T12:50:59.710091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T12:50:59.789990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.789990Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:a8231d5f65a95ec2d02afa8e71a23de94df05260d2556c1c564021376851c7bd","observation_id":"8961faf1-5dfd-496a-aa6c-8be7e5f45def","resolution":{"observed_at":"2026-08-05T12:50:59.789990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:50:59.871156Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.871156Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:856c8f708c5e693862d803948415aaf4bed31bfab7eb34568544db18c1331d2d","observation_id":"2e5cd3d2-23aa-4f5c-98a8-c68ab9b78c3d","resolution":{"observed_at":"2026-08-05T12:50:59.871156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.762129Z","title":null,"venue":null,"work_id":"a9cbbd7e-5157-4efa-b192-58f57193418d","year":2025},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:50:59.935473Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:f35dfd6949d0d0e19ed2f0af7cb99b2d349b81528e21280827110e5f48020731","observation_id":"cb58c9ee-55a7-4e39-b26f-664f097f45a3","resolution":{"observed_at":"2026-08-05T12:51:01.766163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.748581Z","title":null,"venue":null,"work_id":"958f290f-ff38-4072-9d05-b55fcbd3a354","year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.008632Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:c658f7b058759828abc5851d3ff660e60755593cc707f5e750a50fc1a8719d5d","observation_id":"dd669daa-669b-4d2e-999d-a92959458e57","resolution":{"observed_at":"2026-08-05T12:51:01.752455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-13T00:12:52.272658Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-05T12:51:00.115901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.115901Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:8048d467b151d940425e7bce4b1f8785106b575f332c245a2985be4ddf14ea90","observation_id":"28a5a33a-5a88-4d97-acff-9206d9d920fd","resolution":{"observed_at":"2026-08-05T12:51:00.115901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12168","last_updated":"2024-10-16T02:16:53Z","snapshot_observed_at":"2026-08-13T06:23:39.725750Z","submitted_at":"2024-10-16T02:16:53Z","title":"COMET: Towards Partical W4A4KV4 LLMs Serving","version":1},"cited_work":{"arxiv_id":"2410.12168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12168","snapshot_observed_at":"2026-08-05T12:51:01.494910Z","title":"COMET: Towards Partical W4A4KV4 LLMs Serving","venue":"cs.AR","work_id":"9845933c-f04b-4dd8-b08f-c83dcfd55ec9","year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.225256Z"},"links":{"cited_paper":"/paper/2410.12168","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:44391ac1f8936d74a7e79b5b828992372f109f2676c5ec5e842cad629abf76fb","observation_id":"16d86e1e-37b1-41af-baf9-37c7abe3fa62","resolution":{"observed_at":"2026-08-05T12:51:01.499545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-13T11:30:33.812255Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-05T12:51:00.337520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.337520Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:742502370fd151c89669477358662eb41ec08e9f33d315d6d74142ca84e3925c","observation_id":"bbe18e3d-6411-4361-856c-30c03ce71e59","resolution":{"observed_at":"2026-08-05T12:51:00.337520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-05T12:51:00.448570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.448570Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:a23f9a255432e307993dbf4f7033444d1303132026977c26145e4727b66a8ac9","observation_id":"f33c51b6-621f-4308-85da-6c2360e1cdaa","resolution":{"observed_at":"2026-08-05T12:51:00.448570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T12:51:00.524851Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.524851Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:459cd497b30e7684f91645ed95253c09bf9b3df2501ac8c1a42ed0165d744046","observation_id":"a2f26be9-8d3d-4e3e-b6aa-fdcca2ba7596","resolution":{"observed_at":"2026-08-05T12:51:00.524851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.734845Z","title":null,"venue":null,"work_id":"2204e81d-75ac-4d02-8827-e94be0a60ced","year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.635341Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:f3dd58c8a48541e0ce245f6e8eaf720a36421448a7285579b6a2631d804eb5c2","observation_id":"647173bf-de49-49d0-98b8-bdd9b4e5e82f","resolution":{"observed_at":"2026-08-05T12:51:01.738910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:00.710364Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.710364Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:c4d5f3ea514548ecdb7a26ce3a849407fa5dc39c55367e33fc9f3a9a23ea50ed","observation_id":"d30b226d-8ee0-4c29-991d-e5be8695c406","resolution":{"observed_at":"2026-08-05T12:51:00.710364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.711365Z","title":null,"venue":null,"work_id":"ab5a8c56-7d7b-436b-912d-b32f53dfb55c","year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.803648Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:e598753e10a23ec73602facefb15972443f4f9ef4b226eb24797350fd22c7eb0","observation_id":"722f42d6-ee3f-4cd1-b8bc-b777d2f32e5d","resolution":{"observed_at":"2026-08-05T12:51:01.715591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-13T10:27:58.003650Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-05T12:51:00.895682Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.895682Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:7cb7ca1db637be88d131e39ecd5e3f7be8bf982e95f0d5703f8e1c9c9a0dfd9f","observation_id":"23d72f5b-203a-437d-b972-e538b94b3b7c","resolution":{"observed_at":"2026-08-05T12:51:00.895682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10787","last_updated":"2025-07-01T19:43:45Z","snapshot_observed_at":"2026-08-13T04:17:27.622431Z","submitted_at":"2024-02-16T16:10:38Z","title":"Squat: Quant Small Language Models on the Edge","version":2},"cited_work":{"arxiv_id":"2402.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10787","snapshot_observed_at":"2026-08-05T12:51:01.411517Z","title":"Squat: Quant Small Language Models on the Edge","venue":"cs.LG","work_id":"da18a39b-2a23-4ee9-873f-890a3490dce1","year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:00.964875Z"},"links":{"cited_paper":"/paper/2402.10787","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:75cde094a51a5327841482a9cead26e3134b596dc5477bcfcd60631291ca1de3","observation_id":"821ad1a4-168c-4ef8-900d-89c007ed6c61","resolution":{"observed_at":"2026-08-05T12:51:01.418595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T12:51:01.077785Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.077785Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:577e50a8351617683cc2c6d15960879622ebf9695719a44e850c101fdb96bf25","observation_id":"095fda24-251a-40d6-874d-3d58dca313f3","resolution":{"observed_at":"2026-08-05T12:51:01.077785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T12:51:01.158011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.158011Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:ef81c2fa3c77fa48dc6e21f92ab0f9347d14d350331ea6f648fc36d1574fa4d0","observation_id":"16b23d92-a37b-439a-b139-dd9610cfdf59","resolution":{"observed_at":"2026-08-05T12:51:01.158011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-15T04:43:14.762539Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T12:51:01.198277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.198277Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:fcbe7b0e67b44142199cd17d08764fa130c088c10ce2a3b03e2af376cdbf8efd","observation_id":"f68407fc-0970-4982-8aff-875ce0a25f00","resolution":{"observed_at":"2026-08-05T12:51:01.198277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09145","last_updated":"2023-10-23T08:48:31Z","snapshot_observed_at":"2026-08-13T12:00:00.178824Z","submitted_at":"2023-04-18T17:34:23Z","title":"Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09145","snapshot_observed_at":"2026-08-05T12:51:01.202661Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.202661Z"},"links":{"cited_paper":"/paper/2304.09145","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:645330bd0bfe6189a0578f148eb4444e8401059c4185bf18904367ab5ef98ad8","observation_id":"057bd4f2-a8c0-4035-9284-998b1ad53b9a","resolution":{"observed_at":"2026-08-05T12:51:01.202661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.207097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.207097Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:45ee5e9c5ba40fbc6d13710598404ef08e6b2553bceb435bf1f007afe0796eb6","observation_id":"e22a4f09-6b85-47ab-8808-4fe552f61a7b","resolution":{"observed_at":"2026-08-05T12:51:01.207097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11295","last_updated":"2024-11-29T11:47:55Z","snapshot_observed_at":"2026-08-13T04:17:01.673281Z","submitted_at":"2024-02-17T14:26:57Z","title":"OneBit: Towards Extremely Low-bit Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11295","snapshot_observed_at":"2026-08-05T12:51:01.211009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.211009Z"},"links":{"cited_paper":"/paper/2402.11295","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:99a3a4b2c2374a6f398c94776bd985c7b599aa254abd131b040455adf79ea96d","observation_id":"ca793098-5702-4d56-9da1-abd372637612","resolution":{"observed_at":"2026-08-05T12:51:01.211009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T12:51:01.215194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.215194Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:40c190c03e25b2caa3ba7c25e512fa5b93d6ba1781da68de95af5458e440d467","observation_id":"4bfdf7f1-8425-4bf5-bb83-577889c2d4be","resolution":{"observed_at":"2026-08-05T12:51:01.215194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.687181Z","title":null,"venue":null,"work_id":"1dd842e4-e23d-4a6b-b27b-1c069678091d","year":2022},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.219435Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:0d77c0cee6d226830e7c088bd21d6856dd53654ca98441c95ebc7e2162433236","observation_id":"8a0e2c2e-003c-44b8-bea8-7160c5f5309f","resolution":{"observed_at":"2026-08-05T12:51:01.691688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.223251Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.223251Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:c10655b1904214d423b4d7a72fb68133577c6907620d71f7d60d0d7f3aa097c7","observation_id":"916dd6c4-d250-4e2a-9174-e4c7c035e62c","resolution":{"observed_at":"2026-08-05T12:51:01.223251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09904","last_updated":"2024-07-31T07:35:42Z","snapshot_observed_at":"2026-08-12T23:56:12.905367Z","submitted_at":"2024-06-14T10:23:45Z","title":"QQQ: Quality Quattuor-Bit Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09904","snapshot_observed_at":"2026-08-05T12:51:01.231907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.231907Z"},"links":{"cited_paper":"/paper/2406.09904","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:5568c42b2e0bb6df54a2ad14b63a7e0701cd81c763e35ac4e24e92f7f98f1d52","observation_id":"49c6fe9f-3712-4dab-becc-206455f21cbc","resolution":{"observed_at":"2026-08-05T12:51:01.231907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:51:01.663715Z","title":null,"venue":null,"work_id":"4c21d5ac-9c28-4970-b1d8-f74354740a76","year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.236043Z"},"links":{"citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:cf08e6981b297ef7b5a9b073bbb4ea0eb7b04e0e7bfe5049d974061359125f81","observation_id":"74c042ce-ba89-427b-a4d8-66b5bd8a9d7a","resolution":{"observed_at":"2026-08-05T12:51:01.667807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-13T23:09:00.124751Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-05T12:51:01.240091Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.240091Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:bc7df17d53bd4c27a0c531fc9abb6a0adee96aa0ff6544b827269f1e6bd7029d","observation_id":"905c8c31-43ef-4744-a325-f3a148f02657","resolution":{"observed_at":"2026-08-05T12:51:01.240091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-05T12:51:01.227376Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T12:51:01.227376Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2509.01229"},"observation_digest":"sha256:66c1ac9bee795d6b6a050966b62dd66b06ecf93eca65caf00129e009b3aea99c","observation_id":"0e1da5af-0771-4817-955d-d6ae33c03305","resolution":{"observed_at":"2026-08-05T12:51:01.227376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01229","last_updated":"2025-09-01T08:16:20Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T18:50:44.734272Z","submitted_at":"2025-09-01T08:16:20Z","title":"LiquidGEMM: Hardware-Efficient W4A8 GEMM Kernel for High-Performance LLM Serving"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2509.01229."}