{"as_of":"2026-08-10T07:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:43cbd48b4365a5eae14bb0b0e42adb39161230cec4898d90799a3d906ae28ef9","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:52:44.664299Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.01190/citation-record","integrity":"/paper/2509.01190/integrity","json":"/paper/2509.01190/citation-record.json","paper":"/paper/2509.01190"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-05T12:52:44.609841Z","title":"Aaron Grattafiori, Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al- Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Alex Vaughan, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.609841Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:e65de992e0038472db87955fbfad6674943ec5310159a97c9be1301e8ac40ca5","observation_id":"bfa35c9f-fdef-4003-9f08-d30a3be4ddf8","resolution":{"observed_at":"2026-08-05T12:52:44.609841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09266","last_updated":"2023-05-08T13:05:00Z","snapshot_observed_at":"2026-07-06T15:04:11.708950Z","submitted_at":"2023-03-16T12:44:16Z","title":"SmartBERT: A Promotion of Dynamic Early Exiting Mechanism for Accelerating BERT Inference","version":2},"cited_work":{"arxiv_id":"2303.09266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09266","snapshot_observed_at":"2026-08-05T12:52:44.753747Z","title":"SmartBERT: A Promotion of Dynamic Early Exiting Mechanism for Accelerating BERT Inference","venue":"cs.CL","work_id":"af34bf0e-8b7e-4247-964c-0c562664ce8c","year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.629911Z"},"links":{"cited_paper":"/paper/2303.09266","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:e98ec0db5894e073d5c063faece3ee08809842f46130577e46a4d107fa8d4f9f","observation_id":"9617c512-fa86-40b4-ac56-e644275340ea","resolution":{"observed_at":"2026-08-05T12:52:44.760293Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:45.005960Z","title":"Heejun Lee, Minki Kang, Youngwan Lee, and Sung Ju Hwang","venue":null,"work_id":"48bb0571-1278-48b6-b12b-3b5a4e8b3a30","year":2022},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.636353Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:611e19cef3b88f00a9335f0a49e50f3735e0ab40d6cf0601736485784ec8cc8b","observation_id":"fe5ab983-814a-450f-90b0-d9eca33518af","resolution":{"observed_at":"2026-08-05T12:52:45.011281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06619","last_updated":"2023-09-12T22:22:10Z","snapshot_observed_at":"2026-07-06T16:17:43.448660Z","submitted_at":"2023-09-12T22:22:10Z","title":"RT-LM: Uncertainty-Aware Resource Management for Real-Time Inference of Language Models","version":1},"cited_work":{"arxiv_id":"2309.06619","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.06619","snapshot_observed_at":"2026-08-05T12:52:44.714207Z","title":"RT-LM: Uncertainty-Aware Resource Management for Real-Time Inference of Language Models","venue":"cs.LG","work_id":"ccbc0968-b0bf-42f3-8350-cac03871a4e3","year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.641875Z"},"links":{"cited_paper":"/paper/2309.06619","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:96d8b4f0a63e1a04d8efee0a986b5422960ba8c91be290dc798211dccdfc92e3","observation_id":"d5bd6782-a633-4b16-9a0c-2db2ab7e5628","resolution":{"observed_at":"2026-08-05T12:52:44.721825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.963186Z","title":"InProceedings of the 16th conference of the European chapter of the association for computational linguistics: Main V olume, pages 91–104","venue":null,"work_id":"dcc50997-f1f2-4a90-b548-6a9ae9b67f9e","year":2020},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.654033Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:b4e97e2b41868e3787459eba7c3ffd3abb46f731eacff8d418b7c5da80825fa8","observation_id":"3e917123-a917-467e-bf33-8a4af29a9b71","resolution":{"observed_at":"2026-08-05T12:52:44.971096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.933224Z","title":"In 2023 60th ACM/IEEE Design Automation Confer- ence (DAC), pages 1–6","venue":null,"work_id":"0baa0683-7db8-4071-9c9b-8a44f68d780d","year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.658328Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:ce0215b70a7266d726e00e708f797e12d2fadb67d7f49f5545058ec9f822e99a","observation_id":"cf8f6fb1-49bb-4c5b-b2fd-b5ac5bbf8d0d","resolution":{"observed_at":"2026-08-05T12:52:44.938126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.911267Z","title":"Blue squares represent preserved tokens, white squares represent pruned tokens, and the red line indicates the overall preservation trend per layer","venue":null,"work_id":"5044e3e6-33aa-4c84-9e70-47beaa172786","year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.664299Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:1b1dd8c9619a4dc0dca93bad3dbe4363d3ecaee74fd5c4daf87d2851bd54bfd1","observation_id":"107c0efa-055e-4229-8830-5e8482b3c100","resolution":{"observed_at":"2026-08-05T12:52:44.917986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T12:52:44.604653Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.604653Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:617b4749aedded81c89fc8d368be7c772648bbd74171fdf0a97b4a05fda8b425","observation_id":"c16095b2-c899-494f-9a47-984c45f04b98","resolution":{"observed_at":"2026-08-05T12:52:44.604653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T12:52:44.623223Z","title":"Bodun Hu, Jiamin Li, Le Xu, Myungjin Lee, Ak- shay Jajoo, Geon-Woo Kim, Hong Xu, and Aditya Akella","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.623223Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:5b1ed5611a0e26a3df0b3673dd3c706f0fba94f3ce4d9d7c2ab72784d96522ba","observation_id":"aecc832f-0f19-45a3-b2b6-e1f0bdcfac3d","resolution":{"observed_at":"2026-08-05T12:52:44.623223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:52:44.985478Z","title":"InICASSP 2021-2021 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 7713–7717","venue":null,"work_id":"f93db3d8-e6f2-4290-a5ef-d16bd31d1a0a","year":2021},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.649209Z"},"links":{"citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:51e120a8443d1bc9172fbf9d58953bbded4c3fc0cfaface75bfa543cb803f4f6","observation_id":"f0b1ab8e-093c-472a-a808-1026bf03a6c1","resolution":{"observed_at":"2026-08-05T12:52:44.992848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T12:52:44.591356Z","title":"Tianle Cai, Yuhong Li, Zhengyang Geng, Hongwu Peng, Jason D Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.591356Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:914fc46e57ab3c4d8be2a3e1e0bf32f14d94b41ada5c3578e32d641386727b4c","observation_id":"379ad255-dff5-4788-8671-cd5f7f99c0d7","resolution":{"observed_at":"2026-08-05T12:52:44.591356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12023","last_updated":"2024-08-27T00:48:35Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T18:57:41Z","title":"LQ-LoRA: Low-rank Plus Quantized Matrix Decomposition for Efficient Language Model Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12023","snapshot_observed_at":"2026-08-05T12:52:44.617762Z","title":"arXiv preprint arXiv:2311.12023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.617762Z"},"links":{"cited_paper":"/paper/2311.12023","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:36c9347ffea04bac6c5566edf86bc582683df8b558c367eec394d8d1cb1bea4e","observation_id":"1eed93bd-164e-4734-afbc-880163b626f3","resolution":{"observed_at":"2026-08-05T12:52:44.617762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T12:52:44.599095Z","title":"org/abs/2401.10774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:44.599095Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2509.01190"},"observation_digest":"sha256:65fb8e9efb165533437123b1b6324c08a157d8ecd25dc88c4a9d443c973063f6","observation_id":"8bfc1734-8aa2-4359-a406-3592205cbe19","resolution":{"observed_at":"2026-08-05T12:52:44.599095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.01190","last_updated":"2025-09-06T17:46:00Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T10:01:10.307449Z","submitted_at":"2025-09-01T07:15:25Z","title":"Efficient Large Language Models with Zero-Shot Adjustable Acceleration"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2509.01190."}