{"as_of":"2026-08-09T19:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d79685d2e39f331ebbd5a3e93d953c22ceff6fd028e8eb616bcc9074671338de","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:02:10.198594Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23219/citation-record","integrity":"/paper/2505.23219/integrity","json":"/paper/2505.23219/citation-record.json","paper":"/paper/2505.23219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:06.403875Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.403875Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:3549392c1c94354421e65d3c430e661cfde398a0ca03f437322e24b49e1f667d","observation_id":"24ae3333-f6f1-45e2-97c8-e76e0b08e213","resolution":{"observed_at":"2026-08-07T13:02:06.403875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:16.780555Z","title":"Specinfer: Accelerating large language model serving with tree-based speculative inference and ver- ification,","venue":null,"work_id":"620102ed-c5d6-4fdc-bc64-1373d4161dea","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.537216Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:f59b99d3f96320fba6e007d907342bb7be70ec80fb4b1ab4c01f81eff1b55f33","observation_id":"91206771-a7bc-4a05-a2bb-0b33cdef305d","resolution":{"observed_at":"2026-08-07T13:02:16.911548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-07T13:02:06.695859Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.695859Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:1bb3cf4c76afd83c573b699568015312d01e695fed5a5746edcf51a8930c2a47","observation_id":"9fb6f691-5aac-4615-bf7b-817a44725dce","resolution":{"observed_at":"2026-08-07T13:02:06.695859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:16.544921Z","title":"Break the sequential dependency of LLM inference using lookahead decoding,","venue":null,"work_id":"98aee787-5955-41a7-ab63-8d6f06d92e04","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.850459Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:e4ad10806cb9e8d06649b924fd648695fb17b809bc9d5abead6a93eb3a9de15f","observation_id":"94627f43-b782-4c43-bcd0-91244600d07d","resolution":{"observed_at":"2026-08-07T13:02:16.657708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:06.977455Z","title":"Codl: efficient CPU-GPU co-execution for deep learning inference on mobile devices,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.977455Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:c9064420a9958e063a35b56cd6d8f81bcabeea010f28b74b465a312a7244ceb1","observation_id":"a371d8a0-6efc-4a5c-9ca1-5897462139c6","resolution":{"observed_at":"2026-08-07T13:02:06.977455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:16.208359Z","title":"Edgenn: Efficient neural network inference for cpu-gpu integrated edge devices,","venue":null,"work_id":"a4f0362e-ee02-41b8-ab88-884404eea5a4","year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.117354Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:a9847fa64d689b96c413f22fcc3bbc155b153835e9daa3d66443952cf4f32b90","observation_id":"4e581d66-b47b-4ca8-b845-521ed67b90f7","resolution":{"observed_at":"2026-08-07T13:02:16.396266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:15.755599Z","title":"High-throughput cnn inference on embedded arm big. little multicore processors,","venue":null,"work_id":"a279e1df-a125-4135-a0a6-9b6a543ec6da","year":2019},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.252057Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:17d2359c530af4ac5301bb206a0a7a3b2040289350e90a7771566ce49e368a6a","observation_id":"0c9e5fbb-7dfa-4666-9e70-05434b1d00ee","resolution":{"observed_at":"2026-08-07T13:02:15.960000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:15.446137Z","title":"Dopia: online parallelism management for integrated cpu/gpu archi- tectures,","venue":null,"work_id":"b04799ba-ab34-4ba0-b0da-3236f32e2f72","year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.376808Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:4926ff37c50e89d362292c1ab8ff7a946edd553ac3a8ea59271ad62cd20959ac","observation_id":"32fc7452-b213-4759-93c1-5844b13f9b00","resolution":{"observed_at":"2026-08-07T13:02:15.597486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:15.173302Z","title":"Apple m4,","venue":null,"work_id":"c49cb95b-3d3e-4143-93a8-ce3f360bbed6","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.475644Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:4b0ee32a3a6b6a9d08ecdef8f0de229b2c1629c8fbc25d061ab94204c2e1ae34","observation_id":"c2baf9dd-8904-47ae-9ed1-bba66802decb","resolution":{"observed_at":"2026-08-07T13:02:15.312135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:14.853252Z","title":"vllm github,","venue":null,"work_id":"e6545b3d-3068-4dad-8332-43823e40eccf","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.573662Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:72b20e2634cce283dcf0e215a7cab1bfb4a0795a331e0c9df5dace6fe9cba353","observation_id":"a9dad62b-73f1-495f-8299-3ae6003b911f","resolution":{"observed_at":"2026-08-07T13:02:14.987334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T13:02:07.687263Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.687263Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:52995ec7cdac7e66a54dfdd41c2f8704f19fe773e2e845336faf6bd5f0a805a8","observation_id":"58b9bea6-9407-493a-97a4-732d593c3e7f","resolution":{"observed_at":"2026-08-07T13:02:07.687263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17245","last_updated":"2024-05-27T15:01:04Z","snapshot_observed_at":"2026-08-04T21:01:51.439514Z","submitted_at":"2024-05-27T15:01:04Z","title":"Galaxy: A Resource-Efficient Collaborative Edge AI System for In-situ Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17245","snapshot_observed_at":"2026-08-07T13:02:07.770435Z","title":"Galaxy: A resource-efficient collaborative edge ai system for in-situ transformer inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.770435Z"},"links":{"cited_paper":"/paper/2405.17245","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:d1d328d54787ddfe6b80bf630efabf2c4dcd525a549d3fe48dccc68c2c958c47","observation_id":"cefeb681-f9e5-4b0f-bc37-fde6ef58283c","resolution":{"observed_at":"2026-08-07T13:02:07.770435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:14.531212Z","title":"Intel core ultra processor family,","venue":null,"work_id":"1ac4cc60-c61c-4b5a-894e-dc56c025ffe2","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.867375Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:1bb6c116018a6e4f1632ba37bb831863f5514c8339f82ce18953e0305bd781b1","observation_id":"7432d218-f45f-4fdd-8522-98a42ebbed96","resolution":{"observed_at":"2026-08-07T13:02:14.692481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:14.186701Z","title":"Meet jetson, the platform for ai at the edge,","venue":null,"work_id":"f4745504-76b8-4153-83bd-b84199851251","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.993100Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:573a06d1e33eeed491316f663b4e634d8e4cdddf93645da7b1b2e140c6688149","observation_id":"f3fc7d8d-41d0-46f8-9d9f-ff0a5f54c87e","resolution":{"observed_at":"2026-08-07T13:02:14.344380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.912790Z","title":"Communication effi- cient distributed machine learning with the parameter server,","venue":null,"work_id":"aedb8774-689d-40be-bfc2-bc6d471f9489","year":2014},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.088083Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:45ebe2b68680c5a78ebc09daef773eb08cc6f0759eaf2b5d5d51d77ed3b0e194","observation_id":"f5589f97-86ef-487d-8f49-38482ae3dc32","resolution":{"observed_at":"2026-08-07T13:02:14.024404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.592669Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models,","venue":null,"work_id":"cc81bf2b-e05b-4057-96d3-cfaea32663d7","year":null},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.196608Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:a48c14ce2911d4e574be78dbc4f2326e6c7ae85365a0e373f724491abfc39c36","observation_id":"f016866a-0884-484b-9494-5f9d5be016f1","resolution":{"observed_at":"2026-08-07T13:02:13.716687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.346575Z","title":"Codl: efficient cpu-gpu co-execution for deep learning inference on mobile devices","venue":null,"work_id":"cca509c3-164c-4258-852c-156465fe0246","year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.363551Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:9d8cfe12cbdfaa5f11b1c5404792f22ed3bee7efe4335965684cba9528b74024","observation_id":"5a4f5d34-2367-49d8-981a-1361d9009a5b","resolution":{"observed_at":"2026-08-07T13:02:13.472004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:08.445461Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.445461Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:c1b880cb34259a221aecbc7d6453c619f23b1764198b5ba96c34784b324fb755","observation_id":"9c66d894-9c9a-4eb7-98b3-69b0b4c28a22","resolution":{"observed_at":"2026-08-07T13:02:08.445461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08461","last_updated":"2024-03-31T03:06:51Z","snapshot_observed_at":"2026-08-06T22:36:42.010627Z","submitted_at":"2023-10-12T16:21:04Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08461","snapshot_observed_at":"2026-08-07T13:02:08.525545Z","title":"Distillspec: Improving speculative decoding via knowledge distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.525545Z"},"links":{"cited_paper":"/paper/2310.08461","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:fea72c54132afe477ce442e19e8ef6f07afc269b8f3a51ef78ff646e071d199b","observation_id":"5bb6186d-b056-45b1-953a-ddd20e647f17","resolution":{"observed_at":"2026-08-07T13:02:08.525545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.023306Z","title":"EAGLE: speculative sampling requires rethinking feature uncertainty,","venue":null,"work_id":"0cdae09a-4733-450b-acb3-ffa880ab8709","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.621537Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:37e2be0d63d3a260d1f1b275f0ab4a36e6b26b4005405927c87939f3e7a7bfd3","observation_id":"f6096911-0308-49be-a5c8-4507020568d7","resolution":{"observed_at":"2026-08-07T13:02:13.169659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:12.698292Z","title":"Apple a17,","venue":null,"work_id":"039128e6-af93-4eaa-aea2-20bc878a4f0d","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.693852Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:eb32c700d608c8c72952417d717c58013a14ce065725c00cc83fcde199b479d2","observation_id":"9f73d127-3366-4a33-8495-f3a5a873b60d","resolution":{"observed_at":"2026-08-07T13:02:12.863170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:12.395453Z","title":"Amd reveals next-gen desktop processors for extreme pc gam- ing and creator performance,","venue":null,"work_id":"683c7377-ae4c-4e74-82c9-f005d6ff5643","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.789304Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:1788f1438f26cd62c325eda2cadb4f6e65d4f4542e649908ed64a7f51e81b0d1","observation_id":"d9580a79-5031-479f-be40-09730113aa80","resolution":{"observed_at":"2026-08-07T13:02:12.552778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:12.086545Z","title":"Qualcomm snapdragon,","venue":null,"work_id":"fa83ee58-f1f3-4f32-b6c5-788221ef4cc2","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.899326Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:9b28e68611aa2d5af0ae7329bcbef63caa524d15de05d16e8468fdee6cc26758","observation_id":"0a0d0a69-c945-4d6d-b371-6b32b9cb5ad6","resolution":{"observed_at":"2026-08-07T13:02:12.235562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T13:02:09.016191Z","title":"Ring attention with blockwise transformers for near- infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.016191Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:e419a634d777692f4ec6ffc7df148b2af8fe8b752a1ef7009d8bedbbd2e662bc","observation_id":"0ee5fff8-57fe-4f4d-8b57-00257fc7c042","resolution":{"observed_at":"2026-08-07T13:02:09.016191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.768978Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"310ab216-53f6-4722-824b-2b3357c3a218","year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.116736Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:1b806b113b2998ae5ae9f88eed638803222f2062918679c13f1ffe85dc452986","observation_id":"29985fa0-3612-487d-8f4e-3f1164b86d7e","resolution":{"observed_at":"2026-08-07T13:02:11.920095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.567411Z","title":"Wave quantization,","venue":null,"work_id":"629708ff-e78b-44e5-9f4c-5a1b4c932a55","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.228587Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:03bf8497cc57a206fdc6fdadb9ead7cf7d0f3f7a4af663360a33a666935b1553","observation_id":"9b6bcb50-3f38-4bdc-9901-6ba9cc0e51d5","resolution":{"observed_at":"2026-08-07T13:02:11.668637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.338572Z","title":"Nvidia fastertransformer: Transformer related optimization, including bert, gpt,","venue":null,"work_id":"aa84024a-19eb-409b-92c8-01c79b8e8f87","year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.390790Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:82a82ac2195454feb546a7f3aee026f570c7be6dedcb804886e8b4a5a4df0854","observation_id":"f69929ea-c697-4a01-94f8-042787a02f7c","resolution":{"observed_at":"2026-08-07T13:02:11.430108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.156226Z","title":"Ctranslate2,","venue":null,"work_id":"e54c4f63-3d67-4030-a1b7-0ddaf9cada87","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.458408Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:efe486c1635e35d47bcb8fb4d4a5f796859b03cf49be02c0a485d02ca53155c0","observation_id":"9f84d62a-3cc6-4af2-a63b-164c31ab2b39","resolution":{"observed_at":"2026-08-07T13:02:11.228226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:09.524187Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.524187Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:dfd5aeb504210c1546cec8586bf48b14e8f2e217d8b3629795110e325d7ccee3","observation_id":"f060c808-1a7c-4988-9be3-720d8f49e024","resolution":{"observed_at":"2026-08-07T13:02:09.524187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:02:09.585286Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.585286Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:5a8dd6dc38dd1fbf9eebc4176fe9c02c265d3f1295394b04fa378ea4627a1c00","observation_id":"cbe957d3-64d0-4562-ac55-ab52abffefe9","resolution":{"observed_at":"2026-08-07T13:02:09.585286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:02:09.637595Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.637595Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:b973a96acb3c98ea2e3c6e570646f0353a6cb826dc7343712a0916c4c8859865","observation_id":"985f7dad-d686-4f00-91bd-36f94c835bb3","resolution":{"observed_at":"2026-08-07T13:02:09.637595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T13:02:09.703036Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.703036Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:a97b33f1806f7f15567dbf21e3cb3f79caacbdbb3f918e579c66f99fe374f49c","observation_id":"b32f7167-717d-43fe-93a9-d99c0b8e39ff","resolution":{"observed_at":"2026-08-07T13:02:09.703036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T13:02:09.762157Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.762157Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:3f3dffc2c247dbe00eae9ebb485f810eccc96b1aa5c7a3902159809d31ac167e","observation_id":"eaae6fc4-7c10-4305-896f-fc8f7963e2d3","resolution":{"observed_at":"2026-08-07T13:02:09.762157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.00096","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:10.566546Z","title":"Edgenn: Efficient neural network inference for CPU-GPU integrated edge devices,","venue":null,"work_id":"ecdda994-f057-4931-8570-4b0a1713441e","year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.831626Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:0e792c5075628c5d5c12e064fabb6927a93cf4beeff7562b1e1e028a7064a1b4","observation_id":"0de30b68-523e-419a-a089-cada98f314b7","resolution":{"observed_at":"2026-08-07T13:02:10.643834Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:10.957707Z","title":"Taming {Throughput-Latency} tradeoff in {LLM} inference with {Sarathi-Serve},","venue":null,"work_id":"14be6733-6012-458f-bc40-c6cd1a4b5b32","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.895407Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:6d94f1f20704f7e42dbf9ee8957be3a4597bf3096c34d8cea1b15e1562db2a98","observation_id":"5c1462e8-01ac-4aa8-b1ee-df2badc6a558","resolution":{"observed_at":"2026-08-07T13:02:11.067511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:09.955947Z","title":"Communication-efficient model parallelism for distributed in-situ trans- former inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.955947Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:4ccf40f7302e77ba7d61cc378d130bdf69ef61fa1d86a5fed9eb3ff167d049e3","observation_id":"c58228b5-db65-4718-9996-92174d32b9aa","resolution":{"observed_at":"2026-08-07T13:02:09.955947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01188","last_updated":"2023-03-02T19:33:31Z","snapshot_observed_at":"2026-08-09T03:33:05.296150Z","submitted_at":"2022-09-02T17:38:03Z","title":"Petals: Collaborative Inference and Fine-tuning of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01188","snapshot_observed_at":"2026-08-07T13:02:10.010089Z","title":"Petals: Collabo- rative inference and fine-tuning of large models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.010089Z"},"links":{"cited_paper":"/paper/2209.01188","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:2c584f60a6e3ccfd2c018963fa7a7bf61cd1a47039cfbb1b0e2b7930076612bf","observation_id":"3d3743d6-38b0-495b-a278-4c1245722ebb","resolution":{"observed_at":"2026-08-07T13:02:10.010089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7993.34486","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:10.369788Z","title":"Asymo: scalable and efficient deep-learning inference on asymmetric mobile cpus,","venue":null,"work_id":"6b94fffb-2e84-4a89-b9b2-737f91ec0545","year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.076767Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:5bec61045442a3a13fd5fd902c5bd650aa55c5790db1f2d0f6eb27300796b36a","observation_id":"0d670f62-08ce-4a51-8d72-5d4dec06a26e","resolution":{"observed_at":"2026-08-07T13:02:10.429864Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12374","last_updated":"2025-07-05T03:31:01Z","snapshot_observed_at":"2026-08-08T08:32:41.951263Z","submitted_at":"2024-02-19T18:58:32Z","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12374","snapshot_observed_at":"2026-08-07T13:02:10.146184Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.146184Z"},"links":{"cited_paper":"/paper/2402.12374","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:bfdb96503e32cd0d04cb48d22a45356efe10a2f705ed1800731d038800886587","observation_id":"d0fb433f-8dc3-4c79-b65e-8b1912fdd96f","resolution":{"observed_at":"2026-08-07T13:02:10.146184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04255","last_updated":"2023-09-08T10:44:19Z","snapshot_observed_at":"2026-07-06T16:16:07.182657Z","submitted_at":"2023-09-08T10:44:19Z","title":"LLMCad: Fast and Scalable On-device Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04255","snapshot_observed_at":"2026-08-07T13:02:10.198594Z","title":"Llmcad: Fast and scalable on-device large language model inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.198594Z"},"links":{"cited_paper":"/paper/2309.04255","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:3898ee62d247ba48e877aa727cf0657eb130ba9263d6f356079f64624e3f9cea","observation_id":"4012f9de-80bc-48e5-bbbf-2660dc0bc53f","resolution":{"observed_at":"2026-08-07T13:02:10.198594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T13:02:08.290303Z","title":"Available: https://arxiv.org/abs/2309.14509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.290303Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:bda3f6081d804dc8701161d35ff7769af22dd18604473503bf9d2d990d5783cd","observation_id":"84bb3486-6f11-49d1-900f-b3d522f463cb","resolution":{"observed_at":"2026-08-07T13:02:08.290303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-08T16:15:30.488406Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.23219."}