{"as_of":"2026-08-14T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adbea84184aec57bcdc86ebd13795ed7ae3c25f76c00ae19ce74c5bc4a5986bd","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:30:36.140273Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:15:49.289390Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T13:21:35.626449Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"cited_work":{"arxiv_id":"2412.01380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01380","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient llm inference using dynamic input pruning and cache-aware masking","venue":null,"work_id":"92ed369a-abc4-4297-b716-9651a81b2fda","year":null},"citing_paper":{"arxiv_id":"2505.17138","last_updated":"2026-05-18T17:05:12Z","snapshot_observed_at":"2026-08-12T16:06:38.221517Z","submitted_at":"2025-05-22T06:12:42Z","title":"RAP: Runtime Adaptive Pruning for LLM Inference","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T13:20:41.739571Z"},"links":{"cited_paper":"/paper/2412.01380","citing_paper":"/paper/2505.17138"},"observation_digest":"sha256:cc652f13f4cd8976575ee50f6c5ba6455dd606de338416b789f1e47c289a5812","observation_id":"57e8b28b-7346-4cbf-9aca-f48e6a169591","resolution":{"observed_at":"2026-05-22T13:21:35.629058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01380","snapshot_observed_at":"2026-08-05T20:15:49.289390Z","title":"Efficient llm inference using dynamic input pruning and cache-aware masking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10824","last_updated":"2025-08-16T03:17:35Z","snapshot_observed_at":"2026-08-09T19:21:50.118383Z","submitted_at":"2025-08-14T16:48:38Z","title":"Memory-Augmented Transformers: A Systematic Review from Neuroscience Principles to Enhanced Model Architectures","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:49.289390Z"},"links":{"cited_paper":"/paper/2412.01380","citing_paper":"/paper/2508.10824"},"observation_digest":"sha256:df57480be14e26a0f01ff32ab80c53bb2a1e9078a1f9ecb0fe745c170eeab969","observation_id":"244a3fa0-3f99-483d-b108-e6139357ad16","resolution":{"observed_at":"2026-08-05T20:15:49.289390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01380","snapshot_observed_at":"2026-08-03T18:56:59.496372Z","title":"Efficient llm inference using dynamic input pruning and cache-aware masking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-13T17:56:44.348990Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:59.496372Z"},"links":{"cited_paper":"/paper/2412.01380","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:26861afb44dee0995962707a631edf84354feb56b2f2b7c997c2a9392da26178","observation_id":"b1490825-f9dd-4591-a84c-a20a207d8aab","resolution":{"observed_at":"2026-08-03T18:56:59.496372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01380/citation-record","integrity":"/paper/2412.01380/integrity","json":"/paper/2412.01380/citation-record.json","paper":"/paper/2412.01380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T04:30:35.868916Z","title":"A., Awan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.868916Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:ba0ceeed34e2156aaf2075eddc9f5d3bddab149d873a26bb66561d52f11bf95a","observation_id":"99550ca1-e45d-4b67-b230-96d096becd2c","resolution":{"observed_at":"2026-08-12T04:30:35.868916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16635","last_updated":"2024-10-17T15:45:10Z","snapshot_observed_at":"2026-08-12T23:36:06.820078Z","submitted_at":"2024-06-24T13:41:08Z","title":"ShadowLLM: Predictor-based Contextual Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16635","snapshot_observed_at":"2026-08-12T04:30:35.874693Z","title":"F., Dotzel, J., Zhang, Z., Rush, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.874693Z"},"links":{"cited_paper":"/paper/2406.16635","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:d1b372ef10c205fdfb1216eaf9479c48f044e6118502f32291acdcff3688da51","observation_id":"9407622e-fc95-4455-b73a-5bfdd1865fa4","resolution":{"observed_at":"2026-08-12T04:30:35.874693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-13T15:23:42.211600Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-12T04:30:35.880444Z","title":"C., Rastegari, M., and Farajtabar, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.880444Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:d94ca1ffaccc809618b62129ef33103bfdd94cc00cb27c7b1906342a0faa536c","observation_id":"e1733bd0-7572-426d-870d-4a6a60f7c7ac","resolution":{"observed_at":"2026-08-12T04:30:35.880444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T04:30:35.885851Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.885851Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:7142d564ff897f2fdabf64acfe5944db45d5fb7e7315f0f726171e85f4952253","observation_id":"54f6ffc3-c380-4cef-9e91-386af7bbcd0f","resolution":{"observed_at":"2026-08-12T04:30:35.885851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.250391Z","title":null,"venue":null,"work_id":"0d21fa6d-75ec-4ede-80a9-e2b021522130","year":1966},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.890455Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:78ba02d8c74c8743d7f23d316f7fb1de997fe02f9339d7715d67f30484e585bb","observation_id":"cc1078dc-490d-4158-8169-e5a88d67312c","resolution":{"observed_at":"2026-08-12T04:30:37.255188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.232321Z","title":"Smartphones beat dram drum to meet performance demand, 2021","venue":null,"work_id":"ba55b93e-6718-4238-acb8-4ecf3ab82fb0","year":2021},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.895668Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:fc46276182411d00851d72643ca5d30c07907708d76af643ac9b68c9b3113b56","observation_id":"845a17a7-00dc-4003-81bc-f2a6868c3fdb","resolution":{"observed_at":"2026-08-12T04:30:37.239712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.215185Z","title":"How much ram should a phone have, 2023","venue":null,"work_id":"edd73cb1-01a5-4480-811f-f009acfd7b9a","year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.901181Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:9d3f8934eed43279c25905bc7d2cbf0b9b7e575219ada7de61bc2a03e64d97dd","observation_id":"c977e7a0-181c-496e-9c1d-4172fe11b670","resolution":{"observed_at":"2026-08-12T04:30:37.220848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:35.905750Z","title":"N., Fan, A., Auli, M., and Grangier, D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.905750Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:20b0e4a98752e54b9e7e7be160c8d96c7060024a58cc46808ca6f686be9a7998","observation_id":"6f33b5aa-e1b5-4aa1-91f2-422074d7cdd6","resolution":{"observed_at":"2026-08-12T04:30:35.905750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T04:30:35.910387Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.910387Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:c76a2b4b93486b3c4a7cf01ae431d1b226c63f767dc4f2703b55b636d6202cd0","observation_id":"54d12ab3-7d07-47d2-832b-b0e20c642ee6","resolution":{"observed_at":"2026-08-12T04:30:35.910387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:35.915251Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.915251Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:6cc22f594e6f357e4b526b286cce0f20b17165316c6aec0af695cda95430d0bc","observation_id":"aa89924d-8db7-4aa8-8592-bfca4782e7e7","resolution":{"observed_at":"2026-08-12T04:30:35.915251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.15088634","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.175211Z","title":"Code artifact for efficient llm inference using dynamic input pruning and cache-aware masking, March 2025","venue":null,"work_id":"02525e0a-736b-4e74-97d3-46cbf4f3a80c","year":2025},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.919920Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:f85edb1ca32c5c0fd2d823c82d4e067327936572cbc0bc4fb05fb1db42c4471d","observation_id":"53c840b7-2ac2-4992-bc00-60d1e7fde47f","resolution":{"observed_at":"2026-08-12T04:30:36.183513Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:35.924610Z","title":"and Alistarh, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.924610Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:9a772329f456ead823e76c1e42b1dc6c9d529117c920a7050a6188534d67f33b","observation_id":"c96977b5-55f0-4e86-adc9-c0a463f85676","resolution":{"observed_at":"2026-08-12T04:30:35.924610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-12T04:30:35.929393Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.929393Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:0a7335fa5e6df630296582f338ef58c00010908c1d7bb7bc2f46f47663141502","observation_id":"c5a7f179-82da-4fc0-bfa6-429a915aa293","resolution":{"observed_at":"2026-08-12T04:30:35.929393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:35.934418Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.934418Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:2c8d8351c771c3926c30a7ee7097f2c7e7d235926ccbbdcd9434611eb14a16ae","observation_id":"0c69a890-7a6f-436b-a286-0c27c9a20853","resolution":{"observed_at":"2026-08-12T04:30:35.934418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:35.938996Z","title":"W., and Keutzer, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.938996Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:b0936fb40f67bd52f8756b0acb51c4bd74b3bf76641cb20708c991fe3f28a3f4","observation_id":"9a84b3fb-b85c-4189-829e-062bea9a86f5","resolution":{"observed_at":"2026-08-12T04:30:35.938996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.156913Z","title":"and Lorenz, J","venue":null,"work_id":"6e6b5095-c2e8-4dea-9768-9f4654ee0a41","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.943437Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:84076fd9c419ff1de95e98a36a70ff4594bdf070ee208a52589a7ea3630452c2","observation_id":"a52cae37-1f11-4309-9d1f-2f0678d8cf28","resolution":{"observed_at":"2026-08-12T04:30:37.161924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T04:30:35.948004Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.948004Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:8aaaa52e2efbcfd580416d600a687c512bbc894dadbe0343519b5b51921a5eda","observation_id":"de89ce20-02e1-44f0-b1f1-3b77bbc824a1","resolution":{"observed_at":"2026-08-12T04:30:35.948004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T04:30:35.952779Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.952779Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:f07cac3c06e8e875b9c19634bbdb3d6832c6008160fc8d0bb8f5cd81aed60885","observation_id":"c159906b-805b-451f-8773-775215900693","resolution":{"observed_at":"2026-08-12T04:30:35.952779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-13T15:50:33.443969Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-12T04:30:35.957853Z","title":"Billm: Pushing the limit of post-training quantization for llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.957853Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:62e979f6d35ff2aa7547fd5bc3a5e40e8eb3b0b1a3b1a1be5fa277449ff40fc9","observation_id":"980c6f8d-38d7-4218-89d8-32e703c6c764","resolution":{"observed_at":"2026-08-12T04:30:35.957853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.141068Z","title":"and Lin, C","venue":null,"work_id":"d636f931-14bc-4809-96d8-ed6859a75510","year":2016},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.962685Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:f0097ab8372244ed540321289994dba3f9fdd7d340ea3846673b0253cf8cdf9b","observation_id":"96bcb492-48e7-4f5d-9a59-c9ddd76ae092","resolution":{"observed_at":"2026-08-12T04:30:37.146110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.124698Z","title":"Challenges and trends of sram-based computing-in-memory for ai edge devices","venue":null,"work_id":"745ca4e3-852e-49c4-8a3f-649c17f58412","year":2021},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.968421Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:0cf036c4d9d788d45ffeca2545bcc77487f08f247f3b269ae21a1b53cf2dc9ea","observation_id":"7b972b95-ad44-4721-912b-66af0df3758f","resolution":{"observed_at":"2026-08-12T04:30:37.130128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T04:30:35.972943Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.972943Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:db4004926431ac1635695cd370ca3c3b962b52f140dac61b82562ee9902c1146","observation_id":"1ffd6fdc-b3bc-4870-bc4f-035d3326d324","resolution":{"observed_at":"2026-08-12T04:30:35.972943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.108183Z","title":"Pruning vs quantization: Which is better? Advances in neural information processing systems, 36: 0 62414--62427, 2023","venue":null,"work_id":"59951782-5748-4534-9a99-4e53873444a7","year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.977465Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:3bcc694a78b9295a361a8081ff345fa25778bfe6b55a760419c40f54d07ee1a7","observation_id":"f1b47f41-f004-43be-98c0-9698e15ca0fc","resolution":{"observed_at":"2026-08-12T04:30:37.113815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.090714Z","title":"Pruning vs quantization: which is better? Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"a229489b-4ddb-43ae-9b4f-d24683fbf446","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.982024Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:80339b295561046fec351fab8a304ea740589cb89f78d676e17859219b4d3299","observation_id":"f0f7afbc-d75c-482f-8ae6-ecfe48b82a42","resolution":{"observed_at":"2026-08-12T04:30:37.096028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:35.987620Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.987620Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:abe82b5caa7b09b25ea53506c78379559436cbf7eafa9da0a102157ff4457d7b","observation_id":"347859e4-90cd-417d-9aaf-18d7d12244c1","resolution":{"observed_at":"2026-08-12T04:30:35.987620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.062410Z","title":"Apple nvme vs ufs 4.0 storage, 2023","venue":null,"work_id":"faabfa2f-60c6-49ca-890f-69240c766408","year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.992271Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:ef5fd174dc0325ad1e929dba261c3eaddd0c9c666920ddf5bc86590c62b1dd30","observation_id":"6a1c6410-ba49-4e31-994f-f5ca55b5f7af","resolution":{"observed_at":"2026-08-12T04:30:37.068082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08763","last_updated":"2024-11-03T10:25:47Z","snapshot_observed_at":"2026-08-13T00:31:04.489992Z","submitted_at":"2024-04-12T18:42:18Z","title":"CATS: Contextually-Aware Thresholding for Sparsity in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08763","snapshot_observed_at":"2026-08-12T04:30:35.996733Z","title":"Cats: Contextually-aware thresholding for sparsity in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:35.996733Z"},"links":{"cited_paper":"/paper/2404.08763","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:efbc9b763d9476c312a5e7a44947aa2013ed213b67d3bbcd1a9538ccb42ffa15","observation_id":"5d5c0d83-edb6-4a88-b3f4-a6c401ad461e","resolution":{"observed_at":"2026-08-12T04:30:35.996733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:37.045248Z","title":null,"venue":null,"work_id":"f6e804e3-0d2f-49d8-9d18-019ec010c682","year":2022},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.001626Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:df34d5d0990d4f6ea1f0281a5ece8a6537d1f5da74c0fd31d74a45e2d54b1ffc","observation_id":"a047825c-5268-4438-aacf-4ff4eee851a3","resolution":{"observed_at":"2026-08-12T04:30:37.050115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.006409Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.006409Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:f879f2bc9a122fbe73b5de3567d5f8931d799e3da79e110bdf4a8b670d1d009f","observation_id":"ea440abe-924e-4ad6-9b97-e15a61138d6f","resolution":{"observed_at":"2026-08-12T04:30:36.006409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.010972Z","title":"and Vassilvitskii, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.010972Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:53f28bfe0c5bf64e09f5f92ac56d0fb38d9b2cb73e4511c5ce9dc8c29436481c","observation_id":"40c17f66-d939-4db3-a385-2538d8109a1c","resolution":{"observed_at":"2026-08-12T04:30:36.010972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.015725Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.015725Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:c250c939d5b81dc86dd69bb2a31a63bc5c8d483c3a50c397212f0f76d12c1ea5","observation_id":"661d8d82-7e10-4393-8148-858695803850","resolution":{"observed_at":"2026-08-12T04:30:36.015725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-13T05:55:10.276333Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-12T04:30:36.020982Z","title":"C., Tuzel, O., Samei, G., Rastegari, M., and Farajtabar, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.020982Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:af3b43d1a42f3cd2d86329333b37c143416aa85a79ed0b2c9792d77d1faf1c69","observation_id":"33594af2-a8c9-4ee6-8f9b-88a2eb90954b","resolution":{"observed_at":"2026-08-12T04:30:36.020982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08295","last_updated":"2021-06-15T17:12:42Z","snapshot_observed_at":"2026-08-02T11:19:40.664702Z","submitted_at":"2021-06-15T17:12:42Z","title":"A White Paper on Neural Network Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08295","snapshot_observed_at":"2026-08-12T04:30:36.026374Z","title":"A., Bondarenko, Y., Van Baalen, M., and Blankevoort, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.026374Z"},"links":{"cited_paper":"/paper/2106.08295","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:8f37effc254eca1879973403362e526b9d75e70e19d870f6f2289e3778445c45","observation_id":"54c22a46-6e6f-4636-979a-6258aa59bcf4","resolution":{"observed_at":"2026-08-12T04:30:36.026374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-12T04:30:36.031099Z","title":"U., Qiu, S., Saqib, M., Anwar, S., Usman, M., Akhtar, N., Barnes, N., and Mian, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.031099Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:57116f7c20d5c1973e56984801cd01cc697a3e7499839dae6ccb505cc4e1683c","observation_id":"77168a8e-e847-4c47-bc55-aa7753c693a5","resolution":{"observed_at":"2026-08-12T04:30:36.031099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.996480Z","title":"Llama 2: Early adopters’ utilization of meta’s new open-source pretrained model","venue":null,"work_id":"46d9253b-1ee8-48f0-8b13-8f40a2af2113","year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.036146Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:f3ba5345db5fa25d79398792cd69d080993f138f77f8fd59069bf60c81fa2bd0","observation_id":"e87065d3-03dc-4e94-aa3c-bf575b49cace","resolution":{"observed_at":"2026-08-12T04:30:37.001568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.981545Z","title":null,"venue":null,"work_id":"ea31f0c5-cd51-4b6d-aff8-175519b2f371","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.040734Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:30e07ae026af0e272e34e4ad1d0b06e64927d313187f3efd6b6f3b9b139e7144","observation_id":"0808ae4c-4854-4cf7-815b-413bff1b881e","resolution":{"observed_at":"2026-08-12T04:30:36.986475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.965746Z","title":"Effective mimicry of belady’s min policy","venue":null,"work_id":"ceabb55e-264a-4211-9999-bcc184a365e1","year":2022},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.045822Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:4794c5cf3d7c342b7687e1643a1f67b96f3b52c6cdb71800a0bec8aeca59b093","observation_id":"b564d181-3870-4d71-91a6-bba295237c1c","resolution":{"observed_at":"2026-08-12T04:30:36.970840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.949745Z","title":"R., Hestness, J., and Dey, N","venue":null,"work_id":"c4fa5215-5daa-4111-9678-50003ba5631e","year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.050610Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:179876456ee3f9ca27595d80fd85d588a654abfbcee0c33d86da84090cbb1b62","observation_id":"a1f17811-df1d-40ef-b74a-c28de383297f","resolution":{"observed_at":"2026-08-12T04:30:36.955021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13516","last_updated":"2025-01-07T05:26:54Z","snapshot_observed_at":"2026-08-13T04:14:02.008085Z","submitted_at":"2024-02-21T03:58:49Z","title":"ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13516","snapshot_observed_at":"2026-08-12T04:30:36.055200Z","title":"Prosparse: Introducing and enhancing intrinsic activation sparsity within large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.055200Z"},"links":{"cited_paper":"/paper/2402.13516","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:517448b0c172f84cbc7550b54bd06999e92247847dad17f399d637dc36626dec","observation_id":"9653c257-04d8-4d09-be4a-8622a7579b98","resolution":{"observed_at":"2026-08-12T04:30:36.055200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-13T05:00:32.918196Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-12T04:30:36.060140Z","title":"Powerinfer: Fast large language model serving with a consumer-grade gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.060140Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:3d3cccbf68cd6d56718221cf13742c9ef63ea32ad050da3c064f4d169d70f17b","observation_id":"0727e386-f3a9-497b-8cf2-561e39e4bada","resolution":{"observed_at":"2026-08-12T04:30:36.060140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-08-12T23:46:48.915843Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-12T04:30:36.065313Z","title":"Turbo sparse: Achieving llm sota performance with minimal activated parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.065313Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:7097a1107515bc65916f64709766eb7aed493149cf58a96736142ab492d355a2","observation_id":"ba622ce4-2691-4519-87dd-712870577f6a","resolution":{"observed_at":"2026-08-12T04:30:36.065313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.802055Z","title":"Sparse language models with relu activations","venue":null,"work_id":"c1f562ca-adeb-4b58-8a49-9ae0f18077ae","year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.070513Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:49bdc75b61959067a1a1457611fc69ef6e8a92b4ee0ae8a59ebb8984af8e7301","observation_id":"bb59a358-0219-40a4-8d81-8de302534ebf","resolution":{"observed_at":"2026-08-12T04:30:36.807249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-12T04:30:36.075170Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.075170Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:27566368c55fbcb98b247774324b1166771ff6cd538c3097e762cbd3aa983c7a","observation_id":"a0031b78-b421-4dd9-8280-2c322a9c32ae","resolution":{"observed_at":"2026-08-12T04:30:36.075170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15319","last_updated":"2025-06-03T09:22:07Z","snapshot_observed_at":"2026-08-13T04:12:07.303824Z","submitted_at":"2024-02-23T13:39:16Z","title":"GPTVQ: The Blessing of Dimensionality for LLM Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15319","snapshot_observed_at":"2026-08-12T04:30:36.080091Z","title":"Gptvq: The blessing of dimensionality for llm quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.080091Z"},"links":{"cited_paper":"/paper/2402.15319","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:c0c2d26c70dfa195b746db957049c59530fe435f08efd412703a3514136fde73","observation_id":"3088ac87-2ccb-4896-9e5c-2459bfbdc331","resolution":{"observed_at":"2026-08-12T04:30:36.080091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17244","last_updated":"2024-03-20T20:21:58Z","snapshot_observed_at":"2026-08-14T06:04:56.317549Z","submitted_at":"2023-12-28T18:59:09Z","title":"The LLM Surgeon","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17244","snapshot_observed_at":"2026-08-12T04:30:36.094555Z","title":"F., Nagel, M., Van Baalen, M., Asano, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.094555Z"},"links":{"cited_paper":"/paper/2312.17244","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:55d8d3a0c5f1702c88f90afa7f9b4af5452d6687155705a21123592b8fbfce62","observation_id":"6655a9d5-9afc-413a-8fd7-e7ce627e7381","resolution":{"observed_at":"2026-08-12T04:30:36.094555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.785239Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"4d1e55b9-44b1-45bf-bd31-2b218b2a3988","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.099571Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:f98267f0c44f9375ea5e16b33d99d8f31aa1fc5c084f7c4fea26846127a2b043","observation_id":"170d6ec3-2d9b-4302-848e-39d0cc1729f8","resolution":{"observed_at":"2026-08-12T04:30:36.790571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.767362Z","title":"Apple silicon --- Wikipedia , the free encyclopedia, 2024 a","venue":null,"work_id":"adac71e6-7845-41d1-9dd5-28a58d706b46","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.104470Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:4d0899fe3d6094c1e006f86c8bad2ec5d1d83bf6b7a1b54263cf918529e48d8f","observation_id":"9bc7e5cb-0308-46eb-8502-a7c4732ba1c3","resolution":{"observed_at":"2026-08-12T04:30:36.773992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.749466Z","title":"List of qualcomm snapdragon systems on chips --- Wikipedia , the free encyclopedia, 2024 b","venue":null,"work_id":"79a83ba3-9072-4688-be4b-dce7214cb373","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.109317Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:9c372726ee4a3accff24e46186fc1f043617f3b3aa49b5d852268f559e07f066","observation_id":"33a9ae10-e9ca-4ed8-98e0-17fd196aa542","resolution":{"observed_at":"2026-08-12T04:30:36.754752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.733228Z","title":"Flash memory --- Wikipedia , the free encyclopedia, 2024","venue":null,"work_id":"ad612c70-86f5-4fc8-b50e-281e10980d7b","year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.114390Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:978007753c3abf528da3689c239dc2453da8117431f8f3f1838684af8615f40e","observation_id":"3318d1f0-5035-4b36-9cf9-243395fd3c4e","resolution":{"observed_at":"2026-08-12T04:30:36.738500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-12T23:46:28.045919Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-12T04:30:36.119613Z","title":"Powerinfer-2: Fast large language model inference on a smartphone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.119613Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:b28eea6e10bdc1dd8821f0a75e38b78fe7262b7fc54bfa25e3f275231f3643ef","observation_id":"8c7d2330-15c8-4845-b7b3-f9906a84d1b9","resolution":{"observed_at":"2026-08-12T04:30:36.119613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13652","last_updated":"2025-05-20T13:06:00Z","snapshot_observed_at":"2026-08-12T22:40:50.337164Z","submitted_at":"2024-09-20T17:02:00Z","title":"OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13652","snapshot_observed_at":"2026-08-12T04:30:36.124872Z","title":"and Papyan, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.124872Z"},"links":{"cited_paper":"/paper/2409.13652","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:2697309dc5dd32b15b68a3ceb4bb416bec05d79890a5172c0d53077f43c8c41d","observation_id":"08c025d0-cc7a-4893-b154-3e362a848f6d","resolution":{"observed_at":"2026-08-12T04:30:36.124872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T04:30:36.130490Z","title":"V., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.130490Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:c6d15dd9b14800795e319da6e15cbb71fdae6073305a39763c7ae6178ac966da","observation_id":"31f10859-551d-4b20-81e3-9e7caedddce9","resolution":{"observed_at":"2026-08-12T04:30:36.130490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T04:30:36.135498Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.135498Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:59057c4186249e8822bfab47bee7691399b7c3f59f5d8172e02e506f1fa12b98","observation_id":"667f0a38-94ac-477e-93b1-340159c08a00","resolution":{"observed_at":"2026-08-12T04:30:36.135498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:30:36.140273Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T04:30:36.140273Z"},"links":{"citing_paper":"/paper/2412.01380"},"observation_digest":"sha256:db920443d595efe3cd1e364c0eff727c3e74b7e94c6677d4b45a4bac7a8e662f","observation_id":"e3d4b92d-51ca-4b6d-b01c-ea9de18e957e","resolution":{"observed_at":"2026-08-12T04:30:36.140273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01380","last_updated":"2025-04-03T13:28:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T06:25:11.327382Z","submitted_at":"2024-12-02T11:07:51Z","title":"Efficient LLM Inference using Dynamic Input Pruning and Cache-Aware Masking"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 3 inbound Pith citation observations for arXiv:2412.01380."}