{"as_of":"2026-08-17T22:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03b1cfc47a6125d655765a6612c4fdd56886816b4599336941e6b0cb6827e243","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:55:41.247033Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13735/citation-record","integrity":"/paper/2607.13735/integrity","json":"/paper/2607.13735/citation-record.json","paper":"/paper/2607.13735"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-02T03:55:39.877162Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads.arXiv preprint arXiv:2401.10774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:39.877162Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:c91043a5de7ec8c8bbc9aa3fc79bc708e68685572a76b003e48233ba8c89c35f","observation_id":"64528687-9085-466a-988c-25f3391937f9","resolution":{"observed_at":"2026-08-02T03:55:39.877162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-17T19:57:48.664476Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-02T03:55:40.314783Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.314783Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:bfeaef2a9ca7e4d603889013ed030cab693bbbab4de4f8750ba7f8c03fff1e84","observation_id":"c93a4183-b56e-4ef5-ab2f-0cba141bdf49","resolution":{"observed_at":"2026-08-02T03:55:40.314783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-17T08:27:45.946180Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T03:55:40.433775Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.arXiv preprint arXiv:2401.18079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.433775Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:d79835e5fbe32f54a7dfc9e3bbbb09e11f5f6401b63f59c6ccab0408e4e952f3","observation_id":"370400af-5b24-4d45-9b3e-a0fe5069a658","resolution":{"observed_at":"2026-08-02T03:55:40.433775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02784","last_updated":"2023-12-13T13:29:29Z","snapshot_observed_at":"2026-08-17T17:43:27.742669Z","submitted_at":"2023-09-06T06:51:15Z","title":"Norm Tweaking: High-performance Low-bit Quantization of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02784","snapshot_observed_at":"2026-08-02T03:55:40.548166Z","title":"Norm tweaking: High-performance low-bit quantization of large language models.arXiv preprint arXiv:2309.02784, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.548166Z"},"links":{"cited_paper":"/paper/2309.02784","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:a74828bf53f2f9813c600ec0d687ac5b09a5f1f585b0c58ccc02a04b69455d72","observation_id":"db20af93-eb7e-4b9b-8bb2-9d879a52b75d","resolution":{"observed_at":"2026-08-02T03:55:40.548166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-16T15:28:47.324188Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-02T03:55:40.665371Z","title":"Llm-qat: Data-free quantization aware training for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.665371Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:f67241ea5f28f6984fe865da087093e067e572404269e264b472565f603dedc2","observation_id":"19cb1add-ad6b-41f6-ae63-a819d29e2108","resolution":{"observed_at":"2026-08-02T03:55:40.665371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-02T03:55:40.779355Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.779355Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:3ab8f4c0d98ebf574bdd302b8650a464734a7e27fd236de436cb30dd9c483657","observation_id":"eda8e874-d59f-4343-a954-423ffee4a1c1","resolution":{"observed_at":"2026-08-02T03:55:40.779355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:55:40.897846Z","title":"Distilling reasoning capabilities into smaller language models.Findings of the Association for Computational Linguistics: ACL 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.897846Z"},"links":{"citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:083a3adb1e2bde3ba4db26e16dcc94f06231be4f8a475d4fda666d7fad617048","observation_id":"74f57f1b-a497-4f8b-a34a-3c9c416713ae","resolution":{"observed_at":"2026-08-02T03:55:40.897846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-02T03:55:41.015173Z","title":"A simple and effective pruning approach for large language models.arXiv preprint arXiv:2306.11695,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:41.015173Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:8f5fcf193f12dd763f05949af96c7312647beca4fc35b75dd82a68b95780b7cf","observation_id":"641e44b7-2516-4e54-9675-b172ff832c84","resolution":{"observed_at":"2026-08-02T03:55:41.015173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08302","last_updated":"2023-05-26T00:17:06Z","snapshot_observed_at":"2026-08-16T15:48:09.692405Z","submitted_at":"2023-03-15T01:27:15Z","title":"ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08302","snapshot_observed_at":"2026-08-02T03:55:41.125011Z","title":"Zeroquant-v2: Exploring post-training quantization in llms from comprehensive study to low rank compensation.arXiv preprint arXiv:2303.08302,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:41.125011Z"},"links":{"cited_paper":"/paper/2303.08302","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:5cf347deaea84d8797a5b0fbb24edb4f5c20ba8219c8006a79579d892e944505","observation_id":"66defc3c-1c96-409c-be9e-3130e323c914","resolution":{"observed_at":"2026-08-02T03:55:41.125011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18403","last_updated":"2024-08-07T03:30:30Z","snapshot_observed_at":"2026-08-16T15:28:53.781349Z","submitted_at":"2023-05-28T15:15:48Z","title":"LoRAPrune: Structured Pruning Meets Low-Rank Parameter-Efficient Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18403","snapshot_observed_at":"2026-08-02T03:55:41.247033Z","title":"Loraprune: Pruning meets low-rank parameter-efficient fine-tuning.arXiv preprint arXiv:2305.18403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:41.247033Z"},"links":{"cited_paper":"/paper/2305.18403","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:469f4a06ee14bf4ffb9a9614d5c353cdf0842eb262e045d8f047c2cba8ea65e4","observation_id":"72c9aa9b-2a55-434a-8003-4f91bdf4d635","resolution":{"observed_at":"2026-08-02T03:55:41.247033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-08-16T15:18:25.260810Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-02T03:55:40.168571Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.168571Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:27a446ca88d74c82ec71a954698fc5c257272ea28ed5be8af482d8928d07119d","observation_id":"28dd328d-0752-4925-a4a8-742b323b8eca","resolution":{"observed_at":"2026-08-02T03:55:40.168571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-02T03:55:40.066366Z","title":"Tri Dao, Daniel Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.066366Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:f5c530851de17f71c0dbca0f222c429fdf021285b0146d13e163785f2cddb77e","observation_id":"c3983ad0-d2f4-4b19-9723-3a2430f34d74","resolution":{"observed_at":"2026-08-02T03:55:40.066366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-08-10T11:59:11.481480Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-02T03:55:39.951387Z","title":"FrugalGPT: How to use large language models while reducing cost and improving performance.arXiv preprint arXiv:2305.05176,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:39.951387Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:30c7f4f3108a6c335875ce3e7113ef3669a4d75dd805ae2fdb70cb7c55578f2c","observation_id":"b19c3f69-c03e-4e56-aa82-9f815b64f46d","resolution":{"observed_at":"2026-08-02T03:55:39.951387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T11:40:37.184094Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.13735."}