{"as_of":"2026-08-09T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:743f037571cfa046e52f9ea8499531c3f74939cd7fe8076366d96745da5c3d93","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:04:37.517635Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.21835/citation-record","integrity":"/paper/2512.21835/integrity","json":"/paper/2512.21835/citation-record.json","paper":"/paper/2512.21835"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T14:04:33.761205Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:33.761205Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:363e8d320c3f0014a60cfaf6265c78d4e37d8372704fdd05b02d86f2ff0b3aba","observation_id":"347964fc-61d7-4a83-a328-98418ecb40bf","resolution":{"observed_at":"2026-08-03T14:04:33.761205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:33.825769Z","title":"Improving language understanding by generative pre-training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:33.825769Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:4230d69f583817d8b2aeefbf342eaaf6e88bc131538b5d8bc81ef430508dff6e","observation_id":"7f067646-16b2-4be3-8163-2e9422b6aab5","resolution":{"observed_at":"2026-08-03T14:04:33.825769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:33.884490Z","title":"Sasha: creative goal-oriented reasoning in smart homes with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:33.884490Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:0ac39458ac4af751c7764eb531e2322a3d53d1184b66ec46c6f9475a3ab90238","observation_id":"07d77fe5-ce41-4b45-a2df-b5a7371ec808","resolution":{"observed_at":"2026-08-03T14:04:33.884490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-03T14:04:33.995628Z","title":"Gemini robotics: Bringing ai into the physical world,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:33.995628Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:730c76aacb0684c275e9d178351fde2b3a8b8a09667f520afdb51e4dbc9eec83","observation_id":"9ec56baf-10b9-4b35-8efb-e63026edc1ae","resolution":{"observed_at":"2026-08-03T14:04:33.995628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06300","last_updated":"2021-05-13T13:45:28Z","snapshot_observed_at":"2026-07-06T11:09:09.311793Z","submitted_at":"2021-05-13T13:45:28Z","title":"Privacy Inference Attacks and Defenses in Cloud-based Deep Neural Network: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06300","snapshot_observed_at":"2026-08-03T14:04:34.103587Z","title":"Privacy inference attacks and defenses in cloud-based deep neural network: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.103587Z"},"links":{"cited_paper":"/paper/2105.06300","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:1fceb11361e46406daaf6458552b9e8b1ea4ce1355b088ec2edaa78b37e22edc","observation_id":"d1158706-503f-43b3-a1c1-f6546f429006","resolution":{"observed_at":"2026-08-03T14:04:34.103587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.160746Z","title":"Privacy-preserving federated learning for transportation mode prediction based on personal mobility data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.160746Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:622d5a4c98c3f3d00e203ac5670ac31aa43220d03d03e2be7ad80f9ab70ae06b","observation_id":"09d28748-6dee-4d5b-8e0f-faa145f3da81","resolution":{"observed_at":"2026-08-03T14:04:34.160746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.208909Z","title":"Re- search on medical data storage and sharing model based on blockchain,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.208909Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:4b152befd210beeb48f2a0ef826eb05ad565bc1997759c2c136a0bd3b2ed5689","observation_id":"9663b91e-ecee-461f-ace8-78b01e93401a","resolution":{"observed_at":"2026-08-03T14:04:34.208909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.313116Z","title":"{ServerlessLLM}:{Low-Latency}serverless inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.313116Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:9de6491f7d73d2fc7700a9609b572a9bb05f6723eb60d99f42cffc6ac49bc33b","observation_id":"2c5b9380-7a76-4f85-9f18-62f21d860edf","resolution":{"observed_at":"2026-08-03T14:04:34.313116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.422921Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.422921Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:62384583653be533f72ee05fa5c44e43caabebe5c22d151607378101315e6b69","observation_id":"9a95d7e2-e5e6-4848-b422-fa5bd7b96aa3","resolution":{"observed_at":"2026-08-03T14:04:34.422921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.482417Z","title":"Nvidia jetson xavier,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.482417Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:98f37cc955410fe83fce81a56118eb3e69b3f5312d9aff4a64d36e42b4d4779f","observation_id":"08d95cc8-6c3c-4188-a13b-991ba6520659","resolution":{"observed_at":"2026-08-03T14:04:34.482417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.537868Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.537868Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:22a6ba226167bc291fc54c544009072d7db9787d96eaaac29866bce438be2400","observation_id":"bce7fa31-24ac-4b45-979c-dddb123b5dbb","resolution":{"observed_at":"2026-08-03T14:04:34.537868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-08T23:08:43.190961Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-03T14:04:34.644179Z","title":"Spqr: A sparse- quantized representation for near-lossless llm weight compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.644179Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:a1722e57d75d39719f56f40a7e2878e0d5ab0b7ec052b9abc888d607bbd5c4f3","observation_id":"8c40f42f-b3c2-42b6-ac17-82841a3ccebe","resolution":{"observed_at":"2026-08-03T14:04:34.644179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.746272Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.746272Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:88f540ae04e2689218c3add6f68c7f8980c9b8984697ac0218f122e65fc85e13","observation_id":"65590f5b-6841-4d13-a596-b45f86c62864","resolution":{"observed_at":"2026-08-03T14:04:34.746272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-03T14:04:34.853561Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.853561Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:2e168e78ec72c3030b7e33fb2187b745bb0bffbf7f58e73fcd093c41d0726766","observation_id":"1222fb62-48b8-4dcb-9636-2ab067d195f6","resolution":{"observed_at":"2026-08-03T14:04:34.853561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:34.962065Z","title":"Awq: Activation-aware weight quanti- zation for on-device llm compression and acceleration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:34.962065Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:b18c1445b20bf3d4cbb3dab77476ec2a1d9080ee5b892aa0f4bca11db95aed45","observation_id":"107578cc-9dea-4a79-8380-29dc03b4f203","resolution":{"observed_at":"2026-08-03T14:04:34.962065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-03T14:04:35.077208Z","title":"Minillm: Knowledge distillation of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.077208Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:9cb06ffd89c93bb1ee4ca6185deabe563a259209b3b94c36252ade20d02d4178","observation_id":"9f627b4a-b326-4e4e-bfb1-8f4a4da11880","resolution":{"observed_at":"2026-08-03T14:04:35.077208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.184824Z","title":"Less is more: Task-aware layer-wise distillation for language model compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.184824Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:a1fbea081f71c46b44371267e5b34e25a8146d028b6f14d996e7c5d555c3fdcb","observation_id":"4aad829c-bdec-4f0c-bc3e-20f7b6c5e14e","resolution":{"observed_at":"2026-08-03T14:04:35.184824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.292557Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.292557Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:e00c65d64940148a791e193c6419153d64aa103dd00734f3308b6258f6866709","observation_id":"fe458615-5a4c-4155-8bd1-677c24c9fcaf","resolution":{"observed_at":"2026-08-03T14:04:35.292557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.355574Z","title":"Resource-aware federated self-supervised learn- ing with global class representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.355574Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:e4a7c39b19a34ac3003259491a84133c4a492737a2c093a17faa08ddba032e0f","observation_id":"e30c8108-2404-47a1-849f-5cd8af5bafd9","resolution":{"observed_at":"2026-08-03T14:04:35.355574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.463293Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.463293Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:faf25e962b83511acb752d7d7fc321e6c5d0634edf82a6297dc4ab5c41ccab99","observation_id":"6868cb3d-a0ed-43ad-8b16-8f1ed472c0f7","resolution":{"observed_at":"2026-08-03T14:04:35.463293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.521177Z","title":"Unity is power: Semi-asynchronous collaborative training of large-scale models with structured pruning in resource-limited clients,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.521177Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:8e21600a317d94eb432f0a7ce39372e286451024a2de58990a9454c48172dc62","observation_id":"426fa491-f22c-41a2-a4c0-9414821500d4","resolution":{"observed_at":"2026-08-03T14:04:35.521177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-07-06T17:21:01.918787Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-03T14:04:35.628892Z","title":"Slicegpt: Compress large language models by deleting rows and columns,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.628892Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:c766ab3b5180baa3f3fd44173b8bdfc71ea20e24371167f33b9000e1afff6e16","observation_id":"6bee5a92-c87e-4a35-89dd-8fa390fecfbf","resolution":{"observed_at":"2026-08-03T14:04:35.628892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.688378Z","title":"Llm-pruner: On the structural pruning of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.688378Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:1d408f959902c5fb6d9ebb67b7baced8af4406517e11ad37193124b8b61a9413","observation_id":"6634eded-36bc-4e47-b5fd-8f02d0ac0ebc","resolution":{"observed_at":"2026-08-03T14:04:35.688378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.743614Z","title":"Generalization-aware distributed minimax optimization for large-scale models on resource-limited devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.743614Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:bc7c3443a3cb484643a93a704f55d1bdb6644433fdaff28a034618d6db262c60","observation_id":"276674d8-e370-4885-8b8b-a7961b363594","resolution":{"observed_at":"2026-08-03T14:04:35.743614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.789583Z","title":"Theoretical convergence guaranteed resource-adaptive federated learning with mixed heterogeneity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.789583Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:06e70fe7eb9226f2ba3e64eb619498791c849db1ea30a315794d28a7fe925d6e","observation_id":"d5284734-b987-4907-9914-2d0fc84c0a64","resolution":{"observed_at":"2026-08-03T14:04:35.789583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.860427Z","title":"Credit risk analysis using machine and deep learning models,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.860427Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:1c3b240d1bdb79596ecdb848b1b958d1b6bcf68badfaa0c829be71047c98db88","observation_id":"b9348d74-8ef6-4472-b5c2-f4051b35c602","resolution":{"observed_at":"2026-08-03T14:04:35.860427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.893519Z","title":"Medical image analysis using deep learning algorithms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.893519Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:5eb04f690ea86e9cdab5e45d29da499cc8406cf68c5c0ea48c87a3ccb2459d58","observation_id":"eab24cbf-13ad-42b4-b6dc-79d22740a56a","resolution":{"observed_at":"2026-08-03T14:04:35.893519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.963974Z","title":"Pipeedge: Pipeline parallelism for large-scale model inference on heterogeneous edge devices,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.963974Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:b485c3bf01a18f49edd141a6bac21abdfc6087a66f3fe1b026ef22ca15805765","observation_id":"28cfe570-720f-4106-830b-2767489d3dd0","resolution":{"observed_at":"2026-08-03T14:04:35.963974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:35.992124Z","title":"Edgeshard: Efficient llm inference via collaborative edge computing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:35.992124Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:3b7b727b16efdf7a527b3c05b058caf8d1d59303af7e3834f0c09696e5c92e02","observation_id":"0336e8dd-c341-4c79-9508-165368199780","resolution":{"observed_at":"2026-08-03T14:04:35.992124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.010971Z","title":"Galaxy: A resource-efficient collaborative edge ai system for in-situ transformer inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.010971Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:694a0a86fed104e996f3adba3cceda88b79892482f83c97c74ecd82b221f6512","observation_id":"77669c8c-c35c-431b-8035-9531a73be352","resolution":{"observed_at":"2026-08-03T14:04:36.010971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.063253Z","title":"Tpi-llm: Serving 70b-scale llms efficiently on low-resource mobile devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.063253Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:3cf93abc91ef7a4e4e4e7e5dd7429c0734dbaf44708345a0c19237e1f056a7f0","observation_id":"28889b35-fdbd-408b-b30a-7d1d1259c442","resolution":{"observed_at":"2026-08-03T14:04:36.063253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.168116Z","title":"Band: coordinated multi-dnn inference on heterogeneous mobile processors,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.168116Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:fb28a09fbde92d311fa3d5fbe5fee5a2c0c6a8d73797c60b0a1860927824d907","observation_id":"9f461e3b-507e-4f4b-83d4-94c9134b0a53","resolution":{"observed_at":"2026-08-03T14:04:36.168116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.277666Z","title":"Coedge: Cooperative dnn inference with adaptive workload partitioning over heterogeneous edge devices,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.277666Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:26a2a6657cefbf8dbc4c06bf35e186b32d15413524f0821e842f0eb46b9297d7","observation_id":"e8fb5fd0-5b98-40a6-935e-8707d523343b","resolution":{"observed_at":"2026-08-03T14:04:36.277666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.441328Z","title":"Model parallelism optimization for distributed inference via decoupled cnn structure,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.441328Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:f07b00e867b872b854f5c4e904e31e6795094118990aba4245a318af551c43c8","observation_id":"b9d5f377-fc33-4055-b2df-052b3ab73c85","resolution":{"observed_at":"2026-08-03T14:04:36.441328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.589273Z","title":"When the edge meets transformers: Distributed inference with transformer models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.589273Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:d2a8cfeac0bf15679c19d765db3a06ead744458d7916c1e854b528399aba6adc","observation_id":"25b0704f-d791-4f6b-b628-100d4179953b","resolution":{"observed_at":"2026-08-03T14:04:36.589273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.741062Z","title":"Jupiter: Fast and resource-efficient collaborative inference of generative llms on edge devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.741062Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:2e595347819bbc5c7340365c7deb86069c71b1086603eb4313fded234550e617","observation_id":"416b80cd-ab38-49ad-ae6c-0d35398c08e0","resolution":{"observed_at":"2026-08-03T14:04:36.741062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:36.865777Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.865777Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:7f926cee0f011113c2a776b0f4c73fe329aa456fecf82bec8846fc215aacf585","observation_id":"076bfe50-5ba5-4d3a-b77c-fb6b595a5533","resolution":{"observed_at":"2026-08-03T14:04:36.865777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-03T14:04:36.975700Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:36.975700Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:6391593ff9d173000c3ab23bb3cdf4d51d4e085ba99b58fcebc791f22bc5c4bb","observation_id":"748c3806-7c81-4d1d-b196-73247132d685","resolution":{"observed_at":"2026-08-03T14:04:36.975700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:37.104365Z","title":"Pipedream: Generalized pipeline parallelism for dnn training,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:37.104365Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:712e6af795a43f3c9934c47eece961961dd0273c462cbd21dcfe038c85e46d2c","observation_id":"b052bd9a-b3da-46cd-9cb8-bac4877d8eae","resolution":{"observed_at":"2026-08-03T14:04:37.104365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:37.216489Z","title":"Gpipe: Efficient training of giant neu- ral networks using pipeline parallelism,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:37.216489Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:31ff47094d41edf0cc9fa1c1aeac379d09f241a5ba975f87a95dfa4fa024f180","observation_id":"399f08c9-c621-4d54-9d73-0928a71ac8d6","resolution":{"observed_at":"2026-08-03T14:04:37.216489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:37.369007Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:37.369007Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:834ad87f08d45d3308facd7e967fdebc4b7f393349f588ae1f46f4a48663616b","observation_id":"a3df890f-a88d-4903-a1f1-4aef2fa3fd01","resolution":{"observed_at":"2026-08-03T14:04:37.369007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:37.412504Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:37.412504Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:76df49588e20abce2c851d874fe8749dc97b24aef942a79f7030ac2690b966a9","observation_id":"ba45872c-6f51-40ae-bda4-b3e3d980f3ab","resolution":{"observed_at":"2026-08-03T14:04:37.412504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T14:04:37.472113Z","title":"Linux advanced routing & traffic control howto,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:37.472113Z"},"links":{"citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:4c5477b78f18835f26c5cf6b1f8883fd3331d190e1df8c0642058ec3f8170def","observation_id":"838c0edd-4585-4dcc-bfac-e0a520bf3eb4","resolution":{"observed_at":"2026-08-03T14:04:37.472113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T14:04:37.517635Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T14:04:37.517635Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2512.21835"},"observation_digest":"sha256:5baec94aaee4af44dde5373e3f9c1189d20cfcd7fd8167679a7307e978ed9d38","observation_id":"9a6f689e-e879-40b9-a078-8d8160822cbf","resolution":{"observed_at":"2026-08-03T14:04:37.517635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.21835","last_updated":"2026-06-23T08:23:09Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T07:44:15.797133Z","submitted_at":"2025-12-26T02:41:18Z","title":"Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2512.21835."}