{"as_of":"2026-08-19T13:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6b0ec874c61a8d633b41139c7aea9d041d4f048a00d653f372403ebb9a7620b","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:24:35.981169Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:16:42.476185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:27:57.145850Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18934","snapshot_observed_at":"2026-08-07T14:16:42.476185Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19586","last_updated":"2025-05-27T03:16:32Z","snapshot_observed_at":"2026-08-15T13:57:58.824655Z","submitted_at":"2025-05-26T07:00:04Z","title":"TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:16:42.476185Z"},"links":{"cited_paper":"/paper/2412.18934","citing_paper":"/paper/2505.19586"},"observation_digest":"sha256:666952491097ea39678f651e865b9bb255eca63334cf03d8f5eae9a6981ce4cd","observation_id":"32ac6e75-29cb-4ae5-8a7b-7d439bd44850","resolution":{"observed_at":"2026-08-07T14:16:42.476185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"cited_work":{"arxiv_id":"2412.18934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18934","snapshot_observed_at":"2026-07-03T10:27:57.145850Z","title":"arXiv preprint arXiv:2412.18934 , year=","venue":null,"work_id":"f5ed08c8-771d-4adc-a64e-219f3d9a4d12","year":null},"citing_paper":{"arxiv_id":"2606.12303","last_updated":"2026-06-10T16:40:18Z","snapshot_observed_at":"2026-08-12T19:45:50.927620Z","submitted_at":"2026-06-10T16:40:18Z","title":"From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-27T09:58:02.298704Z"},"links":{"cited_paper":"/paper/2412.18934","citing_paper":"/paper/2606.12303"},"observation_digest":"sha256:c5dac540e109aa9dd7ce557fbbc869a6084a42b7cca39412e918fc23f8fa8a90","observation_id":"c1c6e089-7110-44c5-8400-2fd14bf0e2ab","resolution":{"observed_at":"2026-07-03T10:27:57.147259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18934/citation-record","integrity":"/paper/2412.18934/integrity","json":"/paper/2412.18934/citation-record.json","paper":"/paper/2412.18934"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T04:24:35.702293Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.702293Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:edbbce9da44acd80c5e0e622c6d48186a046fc0058ef79ea2286185fae012784","observation_id":"000dfd45-a279-4fd2-9113-d812c4d5e312","resolution":{"observed_at":"2026-08-11T04:24:35.702293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:37.053878Z","title":"Thabet, and Jonas Kohler","venue":null,"work_id":"00968820-6f18-4b3e-8e0b-301ba4f8c512","year":2025},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.709318Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:9ffad6b91965342f7ca2b88b149f12d91741abad981662c5679db2e5ce76238f","observation_id":"a701bdfb-0f30-48b1-b21a-427f58e2288c","resolution":{"observed_at":"2026-08-11T04:24:37.062654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.714786Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.714786Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:7061b41d7c7ccb22136f4c9b4e67432a6a8145325ed6f08b810e26f477e09749","observation_id":"e131f4f7-29d6-4416-bb2f-49166f5d0c14","resolution":{"observed_at":"2026-08-11T04:24:35.714786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-11T04:24:35.723852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.723852Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:f8cf8580fc358b503dc6807a8ae1412c21ac930de7d7fcf9cb984a8f7808bcfa","observation_id":"24557240-c4b2-40f3-8aae-85fbe60a426d","resolution":{"observed_at":"2026-08-11T04:24:35.723852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T04:24:35.731227Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.731227Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:c22b3db01398c02b6ab190d8021a2e7a6a67ffa7288659266b25656c064b4a9a","observation_id":"932ba29f-5093-4ad4-a3fa-e4d8fe379b10","resolution":{"observed_at":"2026-08-11T04:24:35.731227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:37.020001Z","title":null,"venue":null,"work_id":"6d75ab85-e19a-4368-ab86-ae37ae962edc","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.736987Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:e96b64e80ae8679f8b47624e377ebea3d702f99602d2219c0da5fd6fe5b3101a","observation_id":"34843b8e-8c82-4bff-97f9-ff2eee1cd378","resolution":{"observed_at":"2026-08-11T04:24:37.027731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T04:24:35.743276Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.743276Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:0409cdc9103d3480466a6ccdf643a82c3ddd6b711117a75f5e15ea941c3a37b2","observation_id":"575c5942-fa90-46fe-a4f2-d4595f06ca86","resolution":{"observed_at":"2026-08-11T04:24:35.743276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-11T04:24:35.748707Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.748707Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:566b47cd6792344ac6843ef05897d44bb97ce3330d47682caf67fb208528105c","observation_id":"4be0264d-06e4-43cc-8b76-3a4497c0df5a","resolution":{"observed_at":"2026-08-11T04:24:35.748707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09574","last_updated":"2019-02-25T19:18:40Z","snapshot_observed_at":"2026-08-15T00:50:07.769538Z","submitted_at":"2019-02-25T19:18:40Z","title":"The State of Sparsity in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09574","snapshot_observed_at":"2026-08-11T04:24:35.755215Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.755215Z"},"links":{"cited_paper":"/paper/1902.09574","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:769afca79b049b66c9dd496ed183880a66d9fa570ddec48452f881536638e95f","observation_id":"25fb070d-426d-4e2c-b1c9-322133381b7c","resolution":{"observed_at":"2026-08-11T04:24:35.755215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.995109Z","title":null,"venue":null,"work_id":"26fe7824-0471-4a90-9eec-550898283925","year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.761104Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:27990f9dd9289a33564c3af77a08acbf5dd3199d22fd4ba9972d2bd26a5fcd50","observation_id":"1b1f321a-c68a-4c53-bad5-83dc4fbb2508","resolution":{"observed_at":"2026-08-11T04:24:37.001462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.766386Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.766386Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:4ee4d366d045140ab73153d2af20441bbb18bc810a0eb3a6d8d5f0def840b3c8","observation_id":"3d58a0f9-aa71-4c1f-9541-76723e4920a3","resolution":{"observed_at":"2026-08-11T04:24:35.766386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.772007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.772007Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:8ccb2f503ba0036313c49a9c81bca35e11379ed6b3313593278e16b4628c445d","observation_id":"215c9c68-b17f-49ff-b6dc-1bbf2311268b","resolution":{"observed_at":"2026-08-11T04:24:35.772007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.948524Z","title":null,"venue":null,"work_id":"54e0a50c-a1e8-4506-a841-113b703b2128","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.777094Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:d2bfd120734e1a4642317c82b99596f8e80f72657aed31aef0350d15064b0330","observation_id":"6ba1bcf3-20ff-45e5-ac5b-c86505d09123","resolution":{"observed_at":"2026-08-11T04:24:36.954274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.782447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.782447Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:5740ccb95fd16ff9a710addb7efd84813660615f2e6aff4b55062d4680e0335a","observation_id":"bc0846c9-75a7-450f-8f02-35553e695b29","resolution":{"observed_at":"2026-08-11T04:24:35.782447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.919427Z","title":null,"venue":null,"work_id":"90235443-4737-48ab-b8cd-b9ef1c9bbd42","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.787882Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:e54de8a98aeb4cbd0284126715299bf8cd20386fc5f193f51570deeadd85eb1c","observation_id":"fab4fe5b-f57c-40d6-86fb-266be2f349e9","resolution":{"observed_at":"2026-08-11T04:24:36.926274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.793595Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.793595Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:abe24a899acae34305f43141dad3ddb8d5cc569d2ac1e3f8f11a3b1425e9d8ae","observation_id":"2d1bf239-376e-4312-a18d-0b706abe9682","resolution":{"observed_at":"2026-08-11T04:24:35.793595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.803349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.803349Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:0b7718db950363aa422e39bee3b9a44dda0e3ceef959608c78d4bf40db7e0ab0","observation_id":"8ce776c6-8d92-4b62-a54e-8891acde9ee7","resolution":{"observed_at":"2026-08-11T04:24:35.803349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.875186Z","title":null,"venue":null,"work_id":"cd9f6091-7a69-45ff-a258-6eae0f98defb","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.809528Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:03e8519c38a69e86ea13789c1a642f09376ab40440019cf7015f5563ec491072","observation_id":"7b181f5a-3657-46a0-bfcd-428892ae461b","resolution":{"observed_at":"2026-08-11T04:24:36.880878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-08-16T15:32:32.643405Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-11T04:24:35.815578Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.815578Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:fa01370a5bf568bb7603eeaad609243b221d4f1d25caa42907fe98439a0638dd","observation_id":"7703dc54-683b-4bd9-a1ea-f951a7438039","resolution":{"observed_at":"2026-08-11T04:24:35.815578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.854111Z","title":"Gonz \\' a lez","venue":null,"work_id":"14ca34ef-fc33-4e1c-bb7a-ca10ac51d9dd","year":2017},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.822087Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:075b80239f7e933a3555835875594ba27cc8b1dc402e9567353ae6dd52329a41","observation_id":"cc16fb34-d3a1-4204-8bca-a4ee50a724ab","resolution":{"observed_at":"2026-08-11T04:24:36.860180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.827661Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.827661Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:7e0eb4e46af8507a73b1c66565ff7350721263a813b570466d8f06a8f8ddd204","observation_id":"1c459adf-d4fa-43d1-af0a-cd23201d2412","resolution":{"observed_at":"2026-08-11T04:24:35.827661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.823397Z","title":null,"venue":null,"work_id":"6d0dde9d-ebea-46ae-99e4-31ad884320b2","year":2025},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.834997Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:6f08bf27734c6c39c233f3ada722273d205b1726454437eb5a85e4f05845d7c9","observation_id":"fb2c3271-956d-43a5-af7a-1f178f766e21","resolution":{"observed_at":"2026-08-11T04:24:36.829734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-11T04:24:35.840451Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.840451Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:0da45f969b888d221dfe5e81234845528b1b95361c6824b9c47165a73aeec11e","observation_id":"0737972c-c3fb-42c7-a6ec-5a95f28763d6","resolution":{"observed_at":"2026-08-11T04:24:35.840451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.845856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.845856Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:11797af7406ede5bc5d6e91bff9bbf00c2c03c9313d63a13ff53301e816e32a2","observation_id":"3bcabb1c-4178-49af-af46-0b433b307f07","resolution":{"observed_at":"2026-08-11T04:24:35.845856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04623","last_updated":"2023-08-08T23:29:55Z","snapshot_observed_at":"2026-08-16T16:45:25.532419Z","submitted_at":"2023-08-08T23:29:55Z","title":"Accelerating LLM Inference with Staged Speculative Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04623","snapshot_observed_at":"2026-08-11T04:24:35.853031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.853031Z"},"links":{"cited_paper":"/paper/2308.04623","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:da7215d39a05440c16eed2cd6c969f297f568648a06545168e24fcf5f618e644","observation_id":"6bd39a8a-bfcd-4254-9f23-681d46c1caf7","resolution":{"observed_at":"2026-08-11T04:24:35.853031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.804721Z","title":null,"venue":null,"work_id":"6d088c49-d108-406e-8a08-9b43c9121f52","year":2019},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.858428Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:3c0001242de452b2631af7576c1f8e22558960989123c2b132329ef4e16f9627","observation_id":"7568c8c8-f185-4ee0-be83-6a1b558554f6","resolution":{"observed_at":"2026-08-11T04:24:36.810658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.784931Z","title":null,"venue":null,"work_id":"6d468c1a-94ac-4ad1-9292-a588d645a925","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.866000Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:3c17995925c8085736ce8101336ad4e7023c4d9d008c531b14692dc52a364921","observation_id":"f1b39706-09b6-4883-b1d3-881a19e0017d","resolution":{"observed_at":"2026-08-11T04:24:36.792305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.758012Z","title":null,"venue":null,"work_id":"d7d00ad5-78d6-49ea-92f3-7ef606af80e9","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.872363Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:ae253204cb6f53b0dbc3dcc144e2953a50cb830b252d76d95d80ad5a84f9ed9b","observation_id":"290ddd5c-0b5b-4f42-aeb3-027d4c5250ac","resolution":{"observed_at":"2026-08-11T04:24:36.764434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.877105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.877105Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:4559a6a569a3ea0ff81329fb2731ffbe0a605bb91d5c7e49c7a90e266e64df47","observation_id":"137dbdb1-35de-4bba-a2bc-adef1e2c02d6","resolution":{"observed_at":"2026-08-11T04:24:35.877105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T04:24:35.881716Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.881716Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:8790dabaab23b20b1231f817f4358834e88b32d376e047a49a26ad6f3b7d79b5","observation_id":"c3374eb9-b9f1-4393-afbc-bcfec89e7288","resolution":{"observed_at":"2026-08-11T04:24:35.881716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.251","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.097927Z","title":null,"venue":null,"work_id":"7cdc5a7d-01d8-40e7-9e66-0d87e8273be9","year":2020},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.886466Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:1f13600c8d577fd32d1926eec42b1dda3209f403e0966e8bacb9a96cf3784484","observation_id":"8f8eca9e-da26-426e-a6f1-247511d17554","resolution":{"observed_at":"2026-08-11T04:24:36.103768Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.891570Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.891570Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:a7149910ef9fdb34f41bbfdd5c2871d98e568f138482b4894500c481e58c99da","observation_id":"7a77ccc8-3cee-4a02-b3b1-4f5110958483","resolution":{"observed_at":"2026-08-11T04:24:35.891570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.896627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.896627Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:23f39006ada0ebace6237db7b641ec3cc29c86048a65ef67330b7a630c276717","observation_id":"3f5c208a-337a-40f0-a501-12f42d9b3ce2","resolution":{"observed_at":"2026-08-11T04:24:35.896627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.901969Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.901969Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:814558247db726a5c3d0cb3be2a30966c84c7464ab8918ef5a6cb2d9dfe7138b","observation_id":"6a3b866b-f3f3-42ac-9554-528d21d6a627","resolution":{"observed_at":"2026-08-11T04:24:35.901969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.907085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.907085Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:d8c17f263f99b1fc42c8b67a03cbe70b9e94a8a7b78969b8dbaaa0d41251d655","observation_id":"a6e53070-d52c-4e7d-8944-4036caadcbc8","resolution":{"observed_at":"2026-08-11T04:24:35.907085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.712282Z","title":null,"venue":null,"work_id":"e057e605-6b50-43aa-a25a-8b37a0558150","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.912775Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:3b8eba065c600beef4bcbdd34ca91e076bcbfd2c6c83d07f29df48fd12ef5cbe","observation_id":"5003c02c-1199-45a5-9c0e-82bb25a1b57d","resolution":{"observed_at":"2026-08-11T04:24:36.718851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.917530Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.917530Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:c974ba1d345301a2b9069e26937e329564fb6292e92245f19e6c5dcbcd57d160","observation_id":"2d0c31df-27a7-4fd0-b93c-0c2e05fe7d7a","resolution":{"observed_at":"2026-08-11T04:24:35.917530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01528","last_updated":"2025-02-05T03:17:28Z","snapshot_observed_at":"2026-08-16T14:22:05.137315Z","submitted_at":"2024-02-02T16:15:24Z","title":"Decoding Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01528","snapshot_observed_at":"2026-08-11T04:24:35.922407Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.922407Z"},"links":{"cited_paper":"/paper/2402.01528","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:30033720448f860680b221bea21401980e9182124686f8f36b89bf6c1ddf7472","observation_id":"0b4f99b1-608e-4fbe-bc94-afeff6633f09","resolution":{"observed_at":"2026-08-11T04:24:35.922407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T04:24:35.928411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.928411Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:3b645dbe269d40917ed84646cd01c5d9ef6a5bd7b7d011181ced9d994d3ce600","observation_id":"fec4a10f-2931-4168-9c4b-cf65530c9f52","resolution":{"observed_at":"2026-08-11T04:24:35.928411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.677741Z","title":null,"venue":null,"work_id":"a9e40eb8-8f6b-4fbb-aaa4-cf2a1a929b2f","year":2021},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.933807Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:d9f8239b6e288db648e4f11728b8076e126dbfa80823dd345638404de2e2eb75","observation_id":"5cf9f0a6-41d7-4dce-a313-510ea9398f55","resolution":{"observed_at":"2026-08-11T04:24:36.684435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.659058Z","title":null,"venue":null,"work_id":"89610cd7-0858-493c-9ca0-7ecdd7758464","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.938906Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:a1c07ff43e25b26c20a41782001bd26211d52162031b9ae6b6f0ac83e8dd3c06","observation_id":"8a255dfb-a960-4e42-a867-ea1ba2b9eac1","resolution":{"observed_at":"2026-08-11T04:24:36.665713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i17.29922","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:36.042058Z","title":null,"venue":null,"work_id":"c827b6dd-d281-4605-a244-cfdd4963e2eb","year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.943679Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:22817b361310845acf6705f3067680913b60eaa5b73df078d4baed1095c08087","observation_id":"574861c2-9ddd-415e-886f-b6d711a6a856","resolution":{"observed_at":"2026-08-11T04:24:36.048664Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.948863Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.948863Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:197abdd1cca2010d41ea9149ea68d70241a8498c8fb230c64cf30eff58eb2e48","observation_id":"cf925d96-a0b0-432b-8deb-967adb0b2d8b","resolution":{"observed_at":"2026-08-11T04:24:35.948863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-11T04:24:35.954216Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.954216Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:0ebfde70a74d4108cc5377e17812c47e1fe0a40f477df387f3de5548271805a7","observation_id":"d921c1b2-d2aa-4282-b5b0-ba9f2176527f","resolution":{"observed_at":"2026-08-11T04:24:35.954216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.960317Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.960317Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:cc1e92c6717d7089c69151ddd458329ea4a0b382781ab59e77a9e2bc426713f0","observation_id":"42727c0a-1773-4423-a0b9-c7e8d5583029","resolution":{"observed_at":"2026-08-11T04:24:35.960317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.965209Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.965209Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:5efca903de353737c453fdb6dcf077357fbc7dfed4b1f156777d2dfa41cc5787","observation_id":"cc2c4473-0d33-452c-a2b4-d23db04c7cb6","resolution":{"observed_at":"2026-08-11T04:24:35.965209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08461","last_updated":"2024-03-31T03:06:51Z","snapshot_observed_at":"2026-08-16T14:52:38.095793Z","submitted_at":"2023-10-12T16:21:04Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08461","snapshot_observed_at":"2026-08-11T04:24:35.970411Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.970411Z"},"links":{"cited_paper":"/paper/2310.08461","citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:733b543f5285d7684eb8f1aaf082769d411cd28b46afb35faa2d8a369c373267","observation_id":"510fd849-a333-4fc4-9760-abf6eed869f3","resolution":{"observed_at":"2026-08-11T04:24:35.970411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.975492Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.975492Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:07b1a98fa883a9228e007849b818dd3cffd689ca54e177d4b863f7d58074529c","observation_id":"22c85abd-f13e-4e38-9fd9-9e3d7131ebe3","resolution":{"observed_at":"2026-08-11T04:24:35.975492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:24:35.981169Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T04:24:35.981169Z"},"links":{"citing_paper":"/paper/2412.18934"},"observation_digest":"sha256:3a96d54f88dda1a0b7b822f5dc63317e0958363417e885bdfb2adfb91fb20746","observation_id":"1ff95603-5e93-4520-b17d-bac419add9b7","resolution":{"observed_at":"2026-08-11T04:24:35.981169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18934","last_updated":"2025-09-09T14:27:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T23:11:36.062910Z","submitted_at":"2024-12-25T15:45:18Z","title":"Dovetail: A CPU/GPU Heterogeneous Speculative Decoding for LLM inference"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2412.18934."}