{"as_of":"2026-08-10T06:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3875b5fa752cc23928bddf6a470c6803f46f9ea697a66e8287161055af39dba5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":52,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T21:22:24.427154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:57:51.001945Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T13:49:33.747672Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2312.05821"},"observation_digest":"sha256:e171c8078bf03f50a2ceecf3541f05bf9ab31e75d168366c2ef5de8e58be0a8d","observation_id":"90806b5a-d669-4a41-ae24-75184098e22d","resolution":{"observed_at":"2026-05-20T13:49:33.794422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:8a3977c1ae46c9b7b669deadc2ce00bedd9fa7734c726c7df516a74ae1b45d98","observation_id":"456ea09f-255f-4c50-a111-d7d38c867900","resolution":{"observed_at":"2026-05-15T02:39:33.159051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-11T07:53:38.715353Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2409.19256"},"observation_digest":"sha256:a1c6411366c64ca7a5003858b7321963542ca6ef9504ddae5c4e860080014318","observation_id":"a7a73652-6c22-41ac-92fe-6bfd2dedddae","resolution":{"observed_at":"2026-05-11T07:53:38.959988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-09T21:22:24.427154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19113","last_updated":"2025-05-08T12:13:52Z","snapshot_observed_at":"2026-08-09T21:13:49.601237Z","submitted_at":"2025-01-31T13:17:09Z","title":"Genetic AI: Evolutionary Games for ab initio dynamic Multi-Objective Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T21:22:24.427154Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2501.19113"},"observation_digest":"sha256:6e47c821b7a37942b5357804b4882c69e9cb2837fe04dc285bbfce27b44e47b1","observation_id":"16c57e80-98ba-423f-8a67-c216f57374ef","resolution":{"observed_at":"2026-08-09T21:22:24.427154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-09T19:12:56.309924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00425","last_updated":"2025-08-10T04:13:03Z","snapshot_observed_at":"2026-08-10T01:23:32.232654Z","submitted_at":"2025-02-01T13:08:02Z","title":"MQuant: Unleashing the Inference Potential of Multimodal Large Language Models via Full Static Quantization","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T19:12:56.309924Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2502.00425"},"observation_digest":"sha256:c146f6cb1b697adb6d2392dacf4e4b07aff000dc9dfcf1fec29359f0a99654f4","observation_id":"a73d2dac-4e2a-42e9-b7c5-149bf4ab8b80","resolution":{"observed_at":"2026-08-09T19:12:56.309924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-09T11:11:17.815570Z","title":"J., Yan, Y., Chen, B., Sun, G., and Keutzer, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-09T11:04:51.007349Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.815570Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:e9112e38ef8aa9a926d12e4193b2123e9f5935f18f6dc29cfd12fb93394735bd","observation_id":"ecfd4f90-ce9d-497b-a883-24e8b28f6620","resolution":{"observed_at":"2026-08-09T11:11:17.815570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-08T20:31:35.852245Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05043","last_updated":"2025-03-15T19:26:40Z","snapshot_observed_at":"2026-08-09T07:19:40.287753Z","submitted_at":"2025-02-07T16:09:17Z","title":"EcoServe: Designing Carbon-Aware AI Inference Systems","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T20:31:35.852245Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2502.05043"},"observation_digest":"sha256:dba394fb3a5cdd0369f818e88b7c5b2bd961aac6eb76d57be05713ff03f5ace9","observation_id":"2164ac5a-ad2a-4c46-afae-d0fb53ae3d2d","resolution":{"observed_at":"2026-08-08T20:31:35.852245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-08T10:10:23.113427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:23.113427Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:0c506c7656d81d9c35116259a1de3327409e678f7e19bb66e6ff6d81edee8c4f","observation_id":"6ed6c039-3b37-495c-8cbe-b021ae7d85a0","resolution":{"observed_at":"2026-08-08T10:10:23.113427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2503.19950","last_updated":"2025-03-25T16:24:45Z","snapshot_observed_at":"2026-08-02T05:11:13.500453Z","submitted_at":"2025-03-25T16:24:45Z","title":"LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T22:07:37.906916Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2503.19950"},"observation_digest":"sha256:28be0d246a55cebc7fb6639638a72d135dc42aec1ea1d2bd1ed8ed8d3794eaf0","observation_id":"70f92a0a-1dbc-4fd9-840c-8d0f1db5a590","resolution":{"observed_at":"2026-05-22T22:12:11.621335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T15:41:09.214394Z","title":"Llm inference unveiled: Survey and roofline model insights.arXiv preprint arXiv:2402.16363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14302","last_updated":"2025-05-20T12:54:43Z","snapshot_observed_at":"2026-08-07T15:43:23.244437Z","submitted_at":"2025-05-20T12:54:43Z","title":"Scaling Law for Quantization-Aware Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:09.214394Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.14302"},"observation_digest":"sha256:cd7f196cb592707fdf54924b5004828da5fbaf11e522852853703b4d3290d690","observation_id":"ecca2898-dbd4-46c9-b25a-38c76e1393d0","resolution":{"observed_at":"2026-08-07T15:41:09.214394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T15:06:29.707975Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16346","last_updated":"2025-05-23T07:21:27Z","snapshot_observed_at":"2026-08-09T04:28:51.014509Z","submitted_at":"2025-05-22T07:59:26Z","title":"How to keep pushing ML accelerator performance? Know your rooflines!","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:29.707975Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.16346"},"observation_digest":"sha256:14849f24e4658f4aaef5fd5aa6d244b5f3d085c7200af07639298dcac99451a3","observation_id":"97d55eaf-e1ea-4233-aa9f-aea58d0b400a","resolution":{"observed_at":"2026-08-07T15:06:29.707975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:36:28.556122Z","title":"LLM inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18413","last_updated":"2025-05-23T22:39:54Z","snapshot_observed_at":"2026-08-09T17:24:03.281218Z","submitted_at":"2025-05-23T22:39:54Z","title":"LatentLLM: Attention-Aware Joint Tensor Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:28.556122Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.18413"},"observation_digest":"sha256:554267b9508ae8ae8e4312077fbd8d773e8b9f513f977c1b393fe830ae6be869","observation_id":"b93a57aa-0a94-4728-8bc8-8f5214d49e12","resolution":{"observed_at":"2026-08-07T14:36:28.556122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:34:13.984961Z","title":"J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.984961Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:c6c0f320605a41087d789fc5365b764dab7817e8ce5c94cbfe18d06d55256cd0","observation_id":"50a59906-288a-4c38-990d-e47abb93f1d2","resolution":{"observed_at":"2026-08-07T14:34:13.984961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:29:26.256211Z","title":"LLM inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-07T14:22:42.767306Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.256211Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:89dadade441c160282b60c60bad5e8392183f3576429f59c078805f696231fba","observation_id":"2da04287-b6d6-4094-9ce7-7ba8329aa926","resolution":{"observed_at":"2026-08-07T14:29:26.256211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:21:58.446351Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19349","last_updated":"2025-08-08T10:00:47Z","snapshot_observed_at":"2026-08-07T14:13:50.660421Z","submitted_at":"2025-05-25T22:32:35Z","title":"DECA: A Near-Core LLM Decompression Accelerator Grounded on a 3D Roofline Model","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:58.446351Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.19349"},"observation_digest":"sha256:695817fb503c697b250cd8a29f945378aad3409d01433792a8c4bc497a69f012","observation_id":"bb364619-0240-43b7-917f-9b5b2c3920ad","resolution":{"observed_at":"2026-08-07T14:21:58.446351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T10:30:34.430496Z","title":"Llm inference unveiled: Survey and roofline model insights, 2024a.https://arxiv.org/abs/2402.16363","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05333","last_updated":"2025-06-20T01:25:25Z","snapshot_observed_at":"2026-08-07T10:18:59.977399Z","submitted_at":"2025-06-05T17:59:24Z","title":"Kinetics: Rethinking Test-Time Scaling Laws","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:30:34.430496Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2506.05333"},"observation_digest":"sha256:c804916ab5ea075410a778c8497ae3a6d1e5be7b6ffe89e2eef36b7a7d85b495","observation_id":"dcfdf893-6348-4cbd-95bc-e83b1ef50f6a","resolution":{"observed_at":"2026-08-07T10:30:34.430496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T05:56:56.770100Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-07T05:51:34.237166Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.770100Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:8a5592e4636882000f354c7683283488755a5ff9b6c896d6dae70f4f1f4ad524","observation_id":"1d8ad172-a5ce-46a3-ad55-399e14c4ea5e","resolution":{"observed_at":"2026-08-07T05:56:56.770100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-06T22:04:05.650998Z","title":"Llm inference unveiled: Survey and roofline model insights, 2024b,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22742","last_updated":"2025-06-28T03:30:04Z","snapshot_observed_at":"2026-08-06T21:56:37.563688Z","submitted_at":"2025-06-28T03:30:04Z","title":"RAILS: Retrieval-Augmented Intelligence for Learning Software Development","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:05.650998Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2506.22742"},"observation_digest":"sha256:ed938bb584c34f995cb36585b5f7462d409c252b48e74f1c28598f41a3fbe47c","observation_id":"d9042ddc-7027-424a-9e3a-ca490e83a41c","resolution":{"observed_at":"2026-08-06T22:04:05.650998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-05T20:46:50.618756Z","title":"J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10075","last_updated":"2025-08-13T16:27:12Z","snapshot_observed_at":"2026-08-05T20:46:49.193471Z","submitted_at":"2025-08-13T16:27:12Z","title":"Teaching LLMs to Speak Spectroscopy","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T20:46:50.618756Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2508.10075"},"observation_digest":"sha256:173d359608cfcf569b2a174fe069f6357590b1bb989dc4d26d46dd40dfac2285","observation_id":"ca666bfe-4770-47a5-a596-1b322e529a10","resolution":{"observed_at":"2026-08-05T20:46:50.618756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-05T20:37:15.475893Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10395","last_updated":"2025-08-14T06:52:38Z","snapshot_observed_at":"2026-08-08T07:14:54.239021Z","submitted_at":"2025-08-14T06:52:38Z","title":"XQuant: Breaking the Memory Wall for LLM Inference with KV Cache Rematerialization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:37:15.475893Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2508.10395"},"observation_digest":"sha256:309ad9ea81ceec4df99aca552cfa6256d1e2de293ac3a4d6fbdcfe19049de93a","observation_id":"84d11a4a-1084-4bf8-812f-086dfa615dee","resolution":{"observed_at":"2026-08-05T20:37:15.475893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-05T16:03:35.382312Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19087","last_updated":"2025-08-26T14:48:29Z","snapshot_observed_at":"2026-08-07T23:09:15.767029Z","submitted_at":"2025-08-26T14:48:29Z","title":"APT-LLM: Exploiting Arbitrary-Precision Tensor Core Computing for LLM Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T16:03:35.382312Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2508.19087"},"observation_digest":"sha256:dc556a236f8c0ababf22751f8bcc4135af7986c88d05149634586d34a7008f06","observation_id":"50dbda44-73ad-4c8c-b464-a047058de65d","resolution":{"observed_at":"2026-08-05T16:03:35.382312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-04T16:35:33.896184Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12993","last_updated":"2026-07-03T09:21:53Z","snapshot_observed_at":"2026-08-04T16:35:28.483412Z","submitted_at":"2025-09-16T12:04:00Z","title":"HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T16:35:33.896184Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2509.12993"},"observation_digest":"sha256:d0b49017d887324360c41e2b65876139de4d85f6a8413b81bb932a428d78cce3","observation_id":"56688505-a8b2-4bcc-9b9b-e778f36b9c4e","resolution":{"observed_at":"2026-08-04T16:35:33.896184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2601.21351","last_updated":"2026-05-12T02:35:02Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:22:27Z","title":"Analytical Provisioning for Attention-FFN Disaggregated LLM Serving under Stochastic Workloads","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T09:53:13.057587Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2601.21351"},"observation_digest":"sha256:aa437dd3dc70cb9710ce0cb5dff169966b55b989d145492e323b48a9515feb49","observation_id":"159f7077-0ace-467e-af00-344d9027a091","resolution":{"observed_at":"2026-05-16T09:57:43.030400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2602.05695","last_updated":"2026-02-23T09:49:19Z","snapshot_observed_at":"2026-08-07T18:14:32.956858Z","submitted_at":"2026-02-05T14:21:00Z","title":"SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T07:05:56.380048Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2602.05695"},"observation_digest":"sha256:45a2fdaa9446cd64bd4eb808ca3a44110ded4fa3fc1ad21981937613a73c2c95","observation_id":"0d18adca-0792-44d3-890d-59c722e37061","resolution":{"observed_at":"2026-05-16T07:07:29.606715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2604.03298","last_updated":"2026-04-07T13:42:14Z","snapshot_observed_at":"2026-08-02T08:21:56.727699Z","submitted_at":"2026-03-28T16:11:56Z","title":"ENEC: A Lossless AI Model Compression Method Enabling Fast Inference on Ascend NPUs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T21:56:38.684104Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2604.03298"},"observation_digest":"sha256:5a53874893b5048573970f5f21b4ba615b08fa2c8dc51efbddba714781dedad6","observation_id":"147cae87-5bfc-4a14-beb9-9ecd4747d509","resolution":{"observed_at":"2026-05-14T21:58:03.122102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2604.04987","last_updated":"2026-04-05T03:37:30Z","snapshot_observed_at":"2026-07-31T15:20:31.745403Z","submitted_at":"2026-04-05T03:37:30Z","title":"Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T17:36:06.003661Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2604.04987"},"observation_digest":"sha256:558cdf5771ae7e18e77046f7634260418d4601359387fdf01007c165ccb3168c","observation_id":"f5ff9e9a-1a6d-4c80-ac42-0fe94c2f005e","resolution":{"observed_at":"2026-05-13T17:38:02.718186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2604.07144","last_updated":"2026-04-08T14:37:17Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:37:17Z","title":"Autopoiesis: A Self-Evolving System Paradigm for LLM Serving Under Runtime Dynamics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:40.021376Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2604.07144"},"observation_digest":"sha256:d5a3267febc42a19b4c5e963dae0a26f5228a08e50e679c8be59a463680a0630","observation_id":"a65b5d76-97c6-4b4b-a227-02f450f67153","resolution":{"observed_at":"2026-05-11T06:41:19.616843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2604.12358","last_updated":"2026-04-15T17:43:53Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T06:48:31Z","title":"Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T14:50:37.022338Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2604.12358"},"observation_digest":"sha256:abf222a783316214cfd1334b3cf38b746211e54a69f1fae2a20d030b6d472470","observation_id":"045be78f-94a9-4672-9169-9c9e6102a303","resolution":{"observed_at":"2026-05-11T11:31:01.463875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2604.21399","last_updated":"2026-04-23T08:05:10Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T08:05:10Z","title":"A Task Decomposition and Planning Framework for Efficient LLM Inference in AI-Enabled WiFi-Offload Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T14:11:26.862363Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2604.21399"},"observation_digest":"sha256:8ca97ab33dedc6998d907a027c576df39eb56a448edd43365dff6c7a48e01052","observation_id":"056bba68-557b-4834-9c14-b507ffce08df","resolution":{"observed_at":"2026-05-11T18:41:12.821198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.00342","last_updated":"2026-05-01T01:52:01Z","snapshot_observed_at":"2026-08-03T04:07:32.005688Z","submitted_at":"2026-05-01T01:52:01Z","title":"Making Every Verified Token Count: Adaptive Verification for MoE Speculative Decoding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T19:53:40.791974Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.00342"},"observation_digest":"sha256:b5e5a8c3f417193e3d1518b29af98e2ad582331b008d461ef707096b7ed4691b","observation_id":"8ef061b4-f73b-4e58-80d3-c1a271d5a89c","resolution":{"observed_at":"2026-05-11T15:31:05.348415Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.00555","last_updated":"2026-07-21T17:07:05Z","snapshot_observed_at":"2026-08-02T15:09:42.063495Z","submitted_at":"2026-05-01T10:46:38Z","title":"Sim-FA: A GPGPU Simulator Framework for Fine-Grained Asynchronous Pipeline Analysis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T18:43:06.803528Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.00555"},"observation_digest":"sha256:bf91285a26a46ea76abdab58c82be66b26c0d39e5be8f51c2049389b7ed71818","observation_id":"06e377ad-dcda-403a-bccc-88435008d2aa","resolution":{"observed_at":"2026-05-11T16:06:26.967126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-02T15:09:44.098075Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.00555","last_updated":"2026-07-21T17:07:05Z","snapshot_observed_at":"2026-08-02T15:09:42.063495Z","submitted_at":"2026-05-01T10:46:38Z","title":"Sim-FA: A GPGPU Simulator Framework for Fine-Grained Asynchronous Pipeline Analysis","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T15:09:44.098075Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.00555"},"observation_digest":"sha256:20e6ab2ca98a7e09e64ab46515ca05d5683c3eed6d0115ebf17a181f23dffd59","observation_id":"e530f9f2-06aa-4692-912e-9a96b177b4c0","resolution":{"observed_at":"2026-08-02T15:09:44.098075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.03109","last_updated":"2026-05-04T19:48:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T19:48:40Z","title":"Gated Subspace Inference for Transformer Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T19:26:08.510348Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.03109"},"observation_digest":"sha256:35967a8897f9f36035de2b2aafa4a01a95e96ead96ce5346da55d4b9cabfd2fc","observation_id":"e9c5676f-0207-4e02-bdfb-cf1ed7537661","resolution":{"observed_at":"2026-05-12T10:41:31.916138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.04738","last_updated":"2026-05-09T08:06:42Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:35:25Z","title":"OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T18:23:14.935801Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.04738"},"observation_digest":"sha256:83dad4cdc87a66d3ca8a04c128253a043535f530ee787fa52843868e904e39f3","observation_id":"42e9d4d3-7ed4-41d9-a55b-429b60591205","resolution":{"observed_at":"2026-05-09T06:30:44.191274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.04738","last_updated":"2026-05-09T08:06:42Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:35:25Z","title":"OSAQ: Outlier Self-Absorption for Accurate Low-bit LLM Quantization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:59:00.997742Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.04738"},"observation_digest":"sha256:ebde4021a34089672b94870c5fec8582ef23478d20beb028d52f4a8a4b759d9f","observation_id":"b24b8616-dbc5-43d5-a0c1-d1b4ed63a515","resolution":{"observed_at":"2026-05-12T03:01:18.177694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.18071","last_updated":"2026-05-18T08:54:16Z","snapshot_observed_at":"2026-08-02T15:32:20.092680Z","submitted_at":"2026-05-18T08:54:16Z","title":"KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T11:13:46.098095Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.18071"},"observation_digest":"sha256:4cac89f22c85502f9e7df5b0faeec5a14f606fcd63bdca011f4d528fbe08148c","observation_id":"8246754b-f481-416b-9f79-16f07c5cff9c","resolution":{"observed_at":"2026-05-20T11:18:13.959019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2605.30544","last_updated":"2026-05-28T20:21:52Z","snapshot_observed_at":"2026-07-06T23:39:48.531480Z","submitted_at":"2026-05-28T20:21:52Z","title":"On-Device Generative AI for GDPR-Compliant Visual Monitoring: Natural Language Alerts from Local Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T07:51:13.367200Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2605.30544"},"observation_digest":"sha256:a42a360e0d5442c13c7dc0a4929c1c104bf8831086a159b2b511650d3388af28","observation_id":"1bd1c73a-6b8a-45a0-a48f-b7e1d9ba5b0c","resolution":{"observed_at":"2026-06-29T07:53:13.308427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2606.00288","last_updated":"2026-06-24T07:36:07Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T19:20:16Z","title":"Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture","version":3},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-06-28T22:12:13.114405Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2606.00288"},"observation_digest":"sha256:c4cb6fb4426c030383da0cbb9a7d1a47caff8f6ca2e07f4ee37fc61c8097b93f","observation_id":"275b708e-8721-476b-a29a-1fd21f16047b","resolution":{"observed_at":"2026-07-01T19:36:09.263898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2606.08565","last_updated":"2026-06-07T10:43:30Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T10:43:30Z","title":"EinSort: Sorting is All We Need for Tensorizing LLM","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-27T18:31:01.804061Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2606.08565"},"observation_digest":"sha256:8ed0cd6a908fc361a996612580e4a808f701fa578527af328d8a5d1f8d83af73","observation_id":"5bb01164-4430-424f-8618-806e1500196c","resolution":{"observed_at":"2026-07-02T22:57:26.711487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2606.09879","last_updated":"2026-06-03T02:48:34Z","snapshot_observed_at":"2026-08-02T01:41:45.785555Z","submitted_at":"2026-06-03T02:48:34Z","title":"Operator Fusion for LLM Inference on the Tensix Architecture","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T07:01:15.392433Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2606.09879"},"observation_digest":"sha256:98fd515db0dc418426d1bd3d6bedf4c81f80d3ecbff28f1605a3260e971f8067","observation_id":"edaa94ed-94a3-4f1c-85da-db9cf5bf72a7","resolution":{"observed_at":"2026-07-02T07:16:44.969993Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2606.18967","last_updated":"2026-06-17T11:51:06Z","snapshot_observed_at":"2026-08-02T03:11:43.085236Z","submitted_at":"2026-06-17T11:51:06Z","title":"EfficientRollout: System-Aware Self-Speculative Decoding for RL Rollouts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-26T21:32:41.428871Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2606.18967"},"observation_digest":"sha256:2c82b15a088253cabe5eb3c9c7fe427895b44261e0a00b979c840df5b10f3563","observation_id":"d58a23c3-f7e6-4a53-997d-a141d21b67c9","resolution":{"observed_at":"2026-07-03T23:59:07.177818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2606.24957","last_updated":"2026-06-23T08:51:20Z","snapshot_observed_at":"2026-08-06T21:01:25.213982Z","submitted_at":"2026-06-23T08:51:20Z","title":"Dustin: Draft-Augmented Sparse Verification for Efficient Long-Context Generation with Speculative Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:58.636939Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2606.24957"},"observation_digest":"sha256:1dab22df1c47bdd1c3f3d5591e4ab8e41bf03ee93f7520f9f04ede58124b3bef","observation_id":"0c1ecd48-3c85-496f-86e8-8da5a2c8fcfb","resolution":{"observed_at":"2026-07-04T16:49:57.985869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-04T01:23:46.175022Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:c641fb2077be6f708c469807d3640346d917e8f91277567b64a71f6030890d36","observation_id":"71735d02-751c-4462-b4a0-537cf837c9c6","resolution":{"observed_at":"2026-07-04T01:29:22.036003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Llm inference unveiled: Survey and roofline model insights.arXiv preprint arXiv:2402.16363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:96f546b5de85e5a91b50221be8d527682282137b820a1dfdef4a7664b6b6d9a1","observation_id":"335dbaa4-29f2-468a-a406-8b2e36a447af","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-12T11:05:56.233115Z","title":"LLM inference unveiled: Survey and roofline model insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02558","last_updated":"2026-06-28T02:30:44Z","snapshot_observed_at":"2026-08-01T21:25:05.137068Z","submitted_at":"2026-06-28T02:30:44Z","title":"MLSYSIM: First-Principles Infrastructure Modeling for Machine Learning Systems","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-07-12T11:05:56.233115Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.02558"},"observation_digest":"sha256:149a4b9dfa7918df0df9f7f7538cfe6098a00f851a963373360c2213de97e21e","observation_id":"e4ae8fa4-9ab3-4f41-9429-8aca7ece18b7","resolution":{"observed_at":"2026-07-12T11:05:56.233115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-05T07:46:13.093303Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T22:38:12.637901Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:69a4cbc4836a83470794f338ac6e79dbac10bb2bb6bebc01b858a9f0f8e09200","observation_id":"3df85082-7be3-42d5-bf95-d3b761ddf1b2","resolution":{"observed_at":"2026-07-08T22:45:40.136167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":"2402.16363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-11T01:57:51.001945Z","title":"Llm inference unveiled: Survey and roofline model insights","venue":"cs.CL","work_id":"ab1b1623-49b9-406b-9b4a-f5de11424e01","year":2024},"citing_paper":{"arxiv_id":"2607.05876","last_updated":"2026-07-08T02:47:41Z","snapshot_observed_at":"2026-08-05T07:46:13.093303Z","submitted_at":"2026-07-07T06:11:54Z","title":"Think Before You Grid-Search: Floor-First Triage for LLM Serving","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T01:55:09.658053Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.05876"},"observation_digest":"sha256:4bfb754ca30dc7a7defa8671d9eab515f6dfd091e71abea2abe14eb68f19da46","observation_id":"a0405de9-45c6-4168-a446-b473c3262421","resolution":{"observed_at":"2026-07-11T01:57:51.036518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-01T21:12:12.343498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16183","last_updated":"2026-07-17T17:57:49Z","snapshot_observed_at":"2026-08-03T17:36:07.986054Z","submitted_at":"2026-07-17T17:57:49Z","title":"A Blueprint for Equilibrium-Based Differentiable Continuous-Variable Thermodynamic Computing","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-01T21:12:12.343498Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.16183"},"observation_digest":"sha256:1113d735e315177bc9cf04be6412764f0a17f19c9f850917818736847ff5b3d9","observation_id":"8ecd1f7a-97e0-4398-8016-4c8f0275c8f9","resolution":{"observed_at":"2026-08-01T21:12:12.343498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-01T04:58:46.181845Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-09T00:19:38.078824Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.181845Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:9e98dfe006272f54865c773964a8d06a4ebb3db50503f3bae2340e4023357a52","observation_id":"9168e695-d063-4ad4-9634-4fa85f8a9393","resolution":{"observed_at":"2026-08-01T04:58:46.181845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-01T04:49:48.043261Z","title":"arXiv preprint arXiv:2402.16363(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22432","last_updated":"2026-07-24T15:50:23Z","snapshot_observed_at":"2026-08-06T21:57:48.528474Z","submitted_at":"2026-07-24T15:50:23Z","title":"TileSight: A First-Principles Tile-Centric Analytical GPU Performance Model from Cores to Clusters","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T04:49:48.043261Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.22432"},"observation_digest":"sha256:d0d886caebd926fea8528b4e9fdfa7d96a64be2837b5d352cda6406fca3f1f60","observation_id":"7af833aa-6c1b-444c-9024-198ac481d754","resolution":{"observed_at":"2026-08-01T04:49:48.043261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-01T12:00:24.412238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26633","last_updated":"2026-07-29T08:58:04Z","snapshot_observed_at":"2026-08-07T13:12:18.376857Z","submitted_at":"2026-07-29T08:58:04Z","title":"NELSSA: A GPU-PNM Heterogeneous System for Mixed-Length LLM Serving via Length-based Request Placement","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T12:00:24.412238Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.26633"},"observation_digest":"sha256:20abd13946b9a4db350bed17720fbf84edde2947a00ec5a330290e84f0a5308c","observation_id":"9d2d8d7c-48a5-4710-a506-4a869d174421","resolution":{"observed_at":"2026-08-01T12:00:24.412238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-03T04:22:53.202838Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29575","last_updated":"2026-07-31T16:02:31Z","snapshot_observed_at":"2026-08-08T23:05:50.141195Z","submitted_at":"2026-07-31T16:02:31Z","title":"SLIM: Saturation-Aware Lightweight Performance Modeling for LLM Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:53.202838Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.29575"},"observation_digest":"sha256:b443929bdc9b94d973d2db95ac1e8dbf4f9c12b5512aa62ce28b235650fe844b","observation_id":"a133c8c9-ab5f-42b6-a05b-570a8d2e5d44","resolution":{"observed_at":"2026-08-03T04:22:53.202838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.16363/citation-record","integrity":"/paper/2402.16363/integrity","json":"/paper/2402.16363/citation-record.json","paper":"/paper/2402.16363"},"outbound":[],"paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","latest_version":6,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 52 inbound Pith citation observations for arXiv:2402.16363."}