{"as_of":"2026-08-09T15:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5bd011e1bc66a1617b9597ef690b04e91ce99933693452a2b526a2f478ede8b2","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:33:28.517407Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17283/citation-record","integrity":"/paper/2607.17283/integrity","json":"/paper/2607.17283/citation-record.json","paper":"/paper/2607.17283"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-01T18:33:26.682642Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:26.682642Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:9f97c571ecec2ec4b27653570eaabff8686e0541daf52436cb7e6c2e749a88bb","observation_id":"bc8a9d21-da76-4746-8e72-df585b8ad9c9","resolution":{"observed_at":"2026-08-01T18:33:26.682642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-01T18:33:26.778599Z","title":"Accelerating large language model decoding with speculative sampling.arXiv preprint arXiv:2302.01318, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:26.778599Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:375542e4b7b3f76e684d3c9950ea8715076b2abd4056750631e757ffc9a27c1a","observation_id":"af32bd48-f9d0-4483-8347-b1efeb71e4e5","resolution":{"observed_at":"2026-08-01T18:33:26.778599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-01T18:33:26.935597Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:26.935597Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:ce07ba628779e7f22450bdee59598fb3c062e8609f8ec7c882bfb725cd60f6e8","observation_id":"e6630258-6149-4718-9c69-84b91f28d7b8","resolution":{"observed_at":"2026-08-01T18:33:26.935597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-01T18:33:27.108501Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.108501Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:4e67d94b19b1ff64e87605d8908f4acb29ad40fbbdd56c5c8b67a07adb39b0f5","observation_id":"2853b50a-a414-4d2c-9a2f-a6ff562b1d72","resolution":{"observed_at":"2026-08-01T18:33:27.108501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:27.216295Z","title":"llama.cpp: Llm inference in c/c++","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.216295Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:75525e8213e3a593b32321b463ef3594f25746c734ca5273cc8995a467687463","observation_id":"71ca7a7d-8a21-479c-8b54-705a1022b199","resolution":{"observed_at":"2026-08-01T18:33:27.216295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T18:33:27.329122Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.329122Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:a571c38289b2dc59692e2f3b870556281c674a9dc41d365dfc7f04bdd51d5ad7","observation_id":"984db00b-d6bf-45d7-9c01-d28c991b7a83","resolution":{"observed_at":"2026-08-01T18:33:27.329122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-01T18:33:27.398021Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.398021Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:565f81ad69ca065e99c946fd6f42edbc2e370dbcd8dcf2146f80ec53ead8792d","observation_id":"f96753d3-689b-47b8-a309-c7405851a335","resolution":{"observed_at":"2026-08-01T18:33:27.398021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-01T18:33:27.509368Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.509368Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:5f5e90bffb4422c1bcc63c048e88e06e9ee4e021c279ef499f4704514827d5e1","observation_id":"dec97a84-e62c-4ad7-80ec-c75c8483137f","resolution":{"observed_at":"2026-08-01T18:33:27.509368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:27.585718Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.585718Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:e65f43fcacd6124c957b068572ef45c2671b36dc505d9f29c39ca3cf946b4840","observation_id":"021237a4-e639-47d7-ba7a-5fe735ed6d57","resolution":{"observed_at":"2026-08-01T18:33:27.585718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:27.743774Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.743774Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:c071e96f00e1e06a0d0ba63aba5a756431f8d6478768dbcc336203dd951293a7","observation_id":"2ec5cdde-e7db-49bf-ae95-c1cee4808346","resolution":{"observed_at":"2026-08-01T18:33:27.743774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T18:33:27.893184Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.893184Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:59eaf4d70347a9e3c56bec94dd5a0504b08e13a01b7a3fcda5a68d94b953dd63","observation_id":"e9ea590f-ed02-4080-b9b4-d54afb224876","resolution":{"observed_at":"2026-08-01T18:33:27.893184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:27.965333Z","title":"Qwen2.5-0.5b-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.965333Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:ac0d67321ed8910705bd11cc733bec4f038afe09ae5fd3ddae5c9efb5368ff80","observation_id":"98eadb6b-ffbe-4df7-8033-d31588a33b32","resolution":{"observed_at":"2026-08-01T18:33:27.965333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:28.047527Z","title":"Qwen2.5-1.5b-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.047527Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:4d9936f2874b5b19d286780ad02e505e28073bd364c6bb1958e27637b70adee9","observation_id":"347235a7-0119-41ad-9fb0-c0fe1a99449c","resolution":{"observed_at":"2026-08-01T18:33:28.047527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:28.122109Z","title":"Qwen2.5-3b-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.122109Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:d2716131592517994c3a0291175e039446677293dc50de6570e0fabac0b6b9cc","observation_id":"0cc580f8-7666-4432-9551-e9e00b198c0d","resolution":{"observed_at":"2026-08-01T18:33:28.122109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:28.189441Z","title":"Qwen2.5-7b-instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.189441Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:fbe383c639758abb8a6c88b417dd91a5a31bd03ac25330ffb2030c3b11a96e6d","observation_id":"11a6c8fc-78fe-490d-9d9e-cb7d5851ddb3","resolution":{"observed_at":"2026-08-01T18:33:28.189441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.03115","last_updated":"2018-11-07T19:09:40Z","snapshot_observed_at":"2026-07-06T07:13:21.130146Z","submitted_at":"2018-11-07T19:09:40Z","title":"Blockwise Parallel Decoding for Deep Autoregressive Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.03115","snapshot_observed_at":"2026-08-01T18:33:28.266204Z","title":"Blockwise parallel decoding for deep autoregressive models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.266204Z"},"links":{"cited_paper":"/paper/1811.03115","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:fd643015129f0078ef8f5ef1fc635a7616d0444d7429b870370f8c4691fdec1b","observation_id":"e2ceedc1-ee33-459b-873e-2c52ac85a83e","resolution":{"observed_at":"2026-08-01T18:33:28.266204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:33:28.325790Z","title":"Orca: A distributed serving system for transformer-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.325790Z"},"links":{"citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:1324496caf29aea74915fc17f8a2a59bb2cfad725d828424a0c7314ded4e4360","observation_id":"a0c59729-6a6e-428c-b956-12b8962da028","resolution":{"observed_at":"2026-08-01T18:33:28.325790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08168","last_updated":"2024-05-20T02:37:20Z","snapshot_observed_at":"2026-07-06T16:18:49.258642Z","submitted_at":"2023-09-15T05:34:32Z","title":"Draft & Verify: Lossless Large Language Model Acceleration via Self-Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08168","snapshot_observed_at":"2026-08-01T18:33:28.405888Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding.arXiv preprint arXiv:2309.08168, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.405888Z"},"links":{"cited_paper":"/paper/2309.08168","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:684d6169644303d7c186d5faa5e125246e0eeccfbb33e2b734aa632d9865693e","observation_id":"b32bde44-6733-4882-bb56-47e608902053","resolution":{"observed_at":"2026-08-01T18:33:28.405888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-01T18:33:28.517407Z","title":"Tinyllama: An open-source small language model.arXiv preprint arXiv:2401.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:28.517407Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:0857d4fbe476d613c1e8251a68360cc1dba607fd0ab8231fe0bc5b867b3f6cb3","observation_id":"e9fec8b2-ffb2-4095-b6da-a834509de75a","resolution":{"observed_at":"2026-08-01T18:33:28.517407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-01T18:33:27.681434Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.681434Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:3f19434210142467c39e32126c6beb1e173a6fb27cd15a9b664c2af00526b868","observation_id":"8c7371f0-8c92-4900-9b85-eebc15279be7","resolution":{"observed_at":"2026-08-01T18:33:27.681434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-01T18:33:27.814622Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T18:33:27.814622Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2607.17283"},"observation_digest":"sha256:c1417049b80285365d12e55e4f1375ca7ae352969087c01662a1343d4d3181ae","observation_id":"d49e5ae1-74c0-43c9-bcc1-379d0cd95abf","resolution":{"observed_at":"2026-08-01T18:33:27.814622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17283","last_updated":"2026-07-19T15:01:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T09:29:41.628523Z","submitted_at":"2026-07-19T15:01:35Z","title":"Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.17283."}