{"as_of":"2026-08-09T05:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8dafcc67e4c50d6472de3d0f5b4fa9e298955d1fe91362cf131943b7463f3b3a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:42:19.865695Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13093/citation-record","integrity":"/paper/2607.13093/integrity","json":"/paper/2607.13093/citation-record.json","paper":"/paper/2607.13093"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.125500Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.125500Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:d13b792c502996ecd3ed9cba9dd5c73181adfc713d9194cf920b1ada7ebf844f","observation_id":"704996cd-c2f2-4eff-93fe-991f9522c05a","resolution":{"observed_at":"2026-08-02T06:42:15.125500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.165524Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.165524Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:05b7b8ca99b0c69edcb78f00b7c89d2438f0c57dc0f3ece2306018eaade26de2","observation_id":"a244b28b-a60f-4a5a-8424-34b6eba53ff3","resolution":{"observed_at":"2026-08-02T06:42:15.165524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.219713Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.219713Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a780d2711e088de0209750233dc5f7967c7df29c8bea32b48094b5a6e678a9c8","observation_id":"dbf50e4c-e461-40a9-8de9-8898dd6a5caa","resolution":{"observed_at":"2026-08-02T06:42:15.219713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.254849Z","title":"ORCA: A distributed serving system for transformer-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.254849Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:ef0419c1c5f7cf4aa94ec086dbdced08dec2c46adbcd2f3a70ddd4a4bc76534c","observation_id":"59aafbdb-ea91-4138-abbc-039fc7e78970","resolution":{"observed_at":"2026-08-02T06:42:15.254849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.308814Z","title":"DeepSpeed-Inference: Enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.308814Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5397f4daadb35733aba84aaae1b43bd5d4d615438c2bc9ca7294b532935f0b76","observation_id":"9ec4aa2a-05b0-4e4d-9fa1-fbca4f3b12e6","resolution":{"observed_at":"2026-08-02T06:42:15.308814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.386010Z","title":"Neurosurgeon: Collaborative intelligence between the cloud and mobile edge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.386010Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:43fa00ea7a7e4c90d67097d61431ca850d5ad73861bf91647923c2c6a388b72d","observation_id":"7a3237f2-631f-4397-abe2-2bd07717c460","resolution":{"observed_at":"2026-08-02T06:42:15.386010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.418410Z","title":"Split computing and early exiting for deep learning applications: Survey and research challenges.ACM Computing Surveys, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.418410Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:ebd406ab94cfea05b08f8827484db98a75d8d9d87d19a7550d384ab0f8a2d187","observation_id":"a2c8ebfc-c67a-4f6c-8050-c791406b6084","resolution":{"observed_at":"2026-08-02T06:42:15.418410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.469966Z","title":"DNN surgery: Accelerating DNN inference on the edge through layer partitioning.IEEE Transactions on Parallel and Distributed Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.469966Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5d6297592e4bc0ffdddd4fba984aea8952f6821e0549c760536b04bba3bacb8e","observation_id":"be4ee5b6-3c18-4bc6-ace7-ce68744ba00a","resolution":{"observed_at":"2026-08-02T06:42:15.469966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.527834Z","title":"Pipeedge: Pipeline parallelism for large-scale model inference on heterogeneous edge devices","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.527834Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:9db94268f0c01e51843c030893049d839664ffea590e2a6829feab63739e1fd8","observation_id":"5a7f8188-0c65-4f6f-be70-bde979f3536d","resolution":{"observed_at":"2026-08-02T06:42:15.527834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.597558Z","title":"Hybrid SLM and LLM for edge-cloud collaborative inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.597558Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a236872515e5ef3566ff44c8c192f624161b20f9c9c394521bb188e4c523c685","observation_id":"a3e7d1d7-cc21-4428-a652-4b0f664a237c","resolution":{"observed_at":"2026-08-02T06:42:15.597558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.654481Z","title":"Jupiter: Fast and resource-efficient collaborative inference of generative LLMs on edge devices","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.654481Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:fc12dde9d705cf82db3ef4dcc908431f344d5648aa2794598a427c0af4edb066","observation_id":"33614f3b-2045-4f8a-b6b4-4898256a8cef","resolution":{"observed_at":"2026-08-02T06:42:15.654481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12000","last_updated":"2025-07-17T02:34:42Z","snapshot_observed_at":"2026-08-06T16:53:52.190719Z","submitted_at":"2025-07-16T07:55:06Z","title":"DSSD: Efficient Edge-Device LLM Deployment and Collaborative Inference via Distributed Split Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12000","snapshot_observed_at":"2026-08-02T06:42:15.700801Z","title":"DSSD: Efficient edge-device LLM deployment and collaborative inference via distributed split speculative decoding.arXiv preprint arXiv:2507.12000, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.700801Z"},"links":{"cited_paper":"/paper/2507.12000","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:056d6600fddf61bed2f9f2f05c06c911ef48ca1aeb8c716debebd25314ad08c3","observation_id":"50603c84-6301-4705-b54b-b447c97d11af","resolution":{"observed_at":"2026-08-02T06:42:15.700801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.760422Z","title":"CE-CoLLM: Efficient and adaptive large language models through cloud-edge collaboration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.760422Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:6e2940427e05df095eccf284bf532524c4a68c4f8f104574711558789f833d7c","observation_id":"cbd50d06-12a4-4179-8465-1e9474670daa","resolution":{"observed_at":"2026-08-02T06:42:15.760422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.840945Z","title":"Edgeshard: Efficient LLM inference via collaborative edge computing.IEEE Internet of Things Journal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.840945Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:b1f14a5df8c6c0ae4df736467857a595ea8266eebe6fb44991fc8b1d4c5c4157","observation_id":"c13880c8-dbdb-41ce-bce7-e66b06bc695c","resolution":{"observed_at":"2026-08-02T06:42:15.840945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16731","last_updated":"2025-07-22T16:13:43Z","snapshot_observed_at":"2026-08-07T22:15:08.576638Z","submitted_at":"2025-07-22T16:13:43Z","title":"Collaborative Inference and Learning between Edge SLMs and Cloud LLMs: A Survey of Algorithms, Execution, and Open Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16731","snapshot_observed_at":"2026-08-02T06:42:15.915097Z","title":"Collaborative inference and learning between edge SLMs and cloud LLMs: A survey.arXiv preprint arXiv:2507.16731, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.915097Z"},"links":{"cited_paper":"/paper/2507.16731","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:5484afaf27066c38e826e7fedf4898d82051b4f5c0add9c0dcf09f55aefbc1c0","observation_id":"a7e64c04-0db6-4448-8b9c-9944903863d4","resolution":{"observed_at":"2026-08-02T06:42:15.915097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:15.997029Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:15.997029Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:2b66ec3034a99df022d1f46f316059595bfc044933d5dc83e0785028551a26c1","observation_id":"2094fa64-e73e-443d-b654-c8744521eb64","resolution":{"observed_at":"2026-08-02T06:42:15.997029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.090265Z","title":"Accelerating large language model decoding with speculative sampling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.090265Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:07270d8ee63b759b2d70d4387a8f70d31925ac583f492ad2e464544c1eb27163","observation_id":"8dbfbe5d-4166-42a5-a20c-708869b7b6ef","resolution":{"observed_at":"2026-08-02T06:42:16.090265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.143946Z","title":"Specinfer: Accelerating generative large language model serving with tree-based speculative inference and verification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.143946Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:16dbbbc7b69af74a5e969ed904005738cf221d54c8fa3aab08ead30e5ae1cd0c","observation_id":"e31208b4-04d7-439c-be8e-37d33de933a9","resolution":{"observed_at":"2026-08-02T06:42:16.143946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.237006Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.237006Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:20b14e2d3453f7af69ed0e1880984b549d0e34bdfe24c708482cde0ae4596f47","observation_id":"b0df2741-fa12-4b04-ab32-22b12618180a","resolution":{"observed_at":"2026-08-02T06:42:16.237006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.304835Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.304835Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:9362ec92867ba5becac59d3e151f139e80e16425022c2896184e4c5d35d79331","observation_id":"bba04103-6a0d-43b9-b4c3-73db6ab2f825","resolution":{"observed_at":"2026-08-02T06:42:16.304835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.363212Z","title":"EAGLE-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.363212Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:447c65407fb0a04f31d80927b4e0ad490b7503a47271909d087a5e76d0626bae","observation_id":"b204fa25-a9b6-4561-ba1f-334675d9b30d","resolution":{"observed_at":"2026-08-02T06:42:16.363212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.391598Z","title":"Break the sequential dependency of LLM inference using lookahead decoding.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.391598Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a59a3b41aaafc83bfb84428a006e03c09f4d68346225a6b616942fc5896815f4","observation_id":"457a302d-9d3d-4119-ba8a-fa8b5a00785f","resolution":{"observed_at":"2026-08-02T06:42:16.391598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.475568Z","title":"Reddi, and Felix Yu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.475568Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:f8eba2f2d97f09d7919bd47b53e3d3445c96aa41c87434c1e2b1a1afcca5f3e6","observation_id":"20f5b314-7564-4fa3-a578-c7ab3c0859ad","resolution":{"observed_at":"2026-08-02T06:42:16.475568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.542612Z","title":"Layerskip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.542612Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:bd63b9ccf7984224842e1adcbf049e95adf7b2ecc9b1aa40a671660a419bec2e","observation_id":"a752c88b-db56-45de-bc72-a3f4fe9e945e","resolution":{"observed_at":"2026-08-02T06:42:16.542612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.615010Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.615010Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:677acdad9876197aa1c2fc9839d71b9544711d88c2585edc51af5d8d56f2a5ad","observation_id":"7c4cab50-7dea-4036-aa84-f11339118f41","resolution":{"observed_at":"2026-08-02T06:42:16.615010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.702536Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.702536Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:d41b1e1cffdef82a99e2e53816d2969713b1493558e7b3fee334c78b26d4af1a","observation_id":"23008ec9-d20b-479b-b1dc-63915ef94f0b","resolution":{"observed_at":"2026-08-02T06:42:16.702536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:16.739903Z","title":"QLoRA: Efficient finetuning of quantized LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.739903Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:832e8031e0f92309a2a2b1bf6a4b01ef6c99d5f8bbd5c2069627981cac9d5ff2","observation_id":"f66487df-1cd8-46ad-9931-9f26f325fdfb","resolution":{"observed_at":"2026-08-02T06:42:16.739903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00952","last_updated":"2024-07-01T04:13:25Z","snapshot_observed_at":"2026-08-09T00:00:59.056808Z","submitted_at":"2024-07-01T04:13:25Z","title":"SplitLoRA: A Split Parameter-Efficient Fine-Tuning Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00952","snapshot_observed_at":"2026-08-02T06:42:16.876672Z","title":"Splitlora: A split parameter- efficient fine-tuning framework for large language models.arXiv preprint arXiv:2407.00952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:16.876672Z"},"links":{"cited_paper":"/paper/2407.00952","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:1a93b7664abf598c328733cdbcfefd8dcaa1cb06a5345607a4fa68650ef50fa0","observation_id":"8e950cda-cbcb-45d0-8480-7af5fa2c85d0","resolution":{"observed_at":"2026-08-02T06:42:16.876672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12313","last_updated":"2024-03-18T23:20:08Z","snapshot_observed_at":"2026-07-06T17:46:42.199436Z","submitted_at":"2024-03-18T23:20:08Z","title":"Improving LoRA in Privacy-preserving Federated Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12313","snapshot_observed_at":"2026-08-02T06:42:17.098363Z","title":"Improving LoRA in privacy-preserving federated learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.098363Z"},"links":{"cited_paper":"/paper/2403.12313","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:b79307dfaaa7aaead72fe246f7741d51b838bc1d3acc36568c1c4f8a5f73f36a","observation_id":"4798fc88-828b-416f-ae75-d69c30355b48","resolution":{"observed_at":"2026-08-02T06:42:17.098363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.249674Z","title":"On the implicit relation between low-rank adaptation and differential privacy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.249674Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:2ac065fd561b7b24c309a3d61c998cc53178d61fbce24ff7caccdea6fa3b4679","observation_id":"9b9bd033-a26f-4707-8e85-b49ebb328fd1","resolution":{"observed_at":"2026-08-02T06:42:17.249674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.384853Z","title":"Is split learning privacy-preserving for fine-tuning large language models?IEEE Transactions on Big Data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.384853Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:d0e1c2bcf41d23a4b289719bb20765cbcd60460f0880192550b380908e275dd9","observation_id":"87219b76-0a36-4fad-a0be-3076474b4077","resolution":{"observed_at":"2026-08-02T06:42:17.384853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.521863Z","title":"SLDP-LoRA: A privacy-preserving split learning framework with low-rank adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.521863Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:cb9209ecf19fb9dead871af65bfc75a26114e33c10c54cc9fc2ee414287e5291","observation_id":"8a2ee5c0-71e1-41ee-ac6f-15ae965c3402","resolution":{"observed_at":"2026-08-02T06:42:17.521863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09130","last_updated":"2024-08-27T01:28:12Z","snapshot_observed_at":"2026-08-09T05:04:24.926035Z","submitted_at":"2023-10-13T14:17:33Z","title":"Split-and-Denoise: Protect large language model inference with local differential privacy","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09130","snapshot_observed_at":"2026-08-02T06:42:17.678536Z","title":"Split-and-denoise: Protect large language model inference with local differential privacy.arXiv preprint arXiv:2310.09130, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.678536Z"},"links":{"cited_paper":"/paper/2310.09130","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:86dfdc9ae154cf2f9a7c1572fb882c3a59b249309e8ac65b87c3583a52c35cda","observation_id":"c36f73c1-69bf-41a8-95ca-810241f11245","resolution":{"observed_at":"2026-08-02T06:42:17.678536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:17.851965Z","title":"Santos, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:17.851965Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:960b25e767f8bf27ad8c7a82dc9e56292308ef9cf8a0e790e976d16251e3d24e","observation_id":"1483a785-638b-4235-aaee-269cc19c2a66","resolution":{"observed_at":"2026-08-02T06:42:17.851965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.076697Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.076697Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:58d434d41ce8e65c7f1fc4c37a963c72a0161de7521a57528aa218157a1b117d","observation_id":"2dc0dd2e-5e5f-4118-8583-d065b60aefcd","resolution":{"observed_at":"2026-08-02T06:42:18.076697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.194038Z","title":"AWQ: Activation-aware weight quantization for on-device LLM compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.194038Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:3715aa734702afea7758bb776dea410e9fdfe52f5690bb57caef8fd352d35ca3","observation_id":"67ea7582-74b1-4a21-be37-a25d1d408574","resolution":{"observed_at":"2026-08-02T06:42:18.194038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.257172Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.257172Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:feb924ff6763c2ff55c68aade5352db8e10d4f7de27b42682740d8eb52f9ddc2","observation_id":"143f02b4-ff8e-46cf-a862-004b59d02e04","resolution":{"observed_at":"2026-08-02T06:42:18.257172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.321759Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.321759Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:b7252422e8a0e354b48b4bdc12d7ac168148759a95ddd24e24f2a12d67059b21","observation_id":"7c1bc7fc-10c5-48be-88d3-35dbd3e50c00","resolution":{"observed_at":"2026-08-02T06:42:18.321759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.401946Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.401946Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:614d6b1f1403ef03fea265e0b11ba2ada847915033cfa9a3f269a6bc266ea5ef","observation_id":"58f287d4-07cc-4f10-bbab-3abaead8bc27","resolution":{"observed_at":"2026-08-02T06:42:18.401946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.479747Z","title":"Efficient LLM inference on CPUs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.479747Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:b399a50d05a30f29c76359872f3dac668b5b9a4875c5a02960a2b3ccbf7e0d55","observation_id":"62123e57-7a91-474e-9325-b83a21c203bc","resolution":{"observed_at":"2026-08-02T06:42:18.479747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.566986Z","title":"H2O: Heavy-hitter oracle for accurate KV cache compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.566986Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:a57e0154c80f03c77fa2528f53969400960aee1a7148fb268ad3cf9b77c8faae","observation_id":"715331ba-a009-48c1-a933-2b3ebe623b87","resolution":{"observed_at":"2026-08-02T06:42:18.566986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.679844Z","title":"Streamingllm: Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.679844Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:4f43036f23f875105106d0804e24941b7f3161508a0bc85dafbea1842f7f06a3","observation_id":"487eca1a-41f9-4c73-9bdd-671413163a11","resolution":{"observed_at":"2026-08-02T06:42:18.679844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.791543Z","title":"Recommendation for block cipher modes of operation: Ga- lois/counter mode (gcm) and gmac","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.791543Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:bf4c6cc4502a5617cfd1011172f44a90c5e0b81d32f7150bef9888f5fca76691","observation_id":"81176a82-252d-409c-ad5d-184fe5b7b48b","resolution":{"observed_at":"2026-08-02T06:42:18.791543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.867792Z","title":"BOLT: Privacy-preserving, accurate and efficient inference for transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.867792Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:0283c444d12b4500d3913fe6776f37b50d42dc3d9684ad38accdf609b30ccead","observation_id":"13e26c63-4711-4bdf-bec6-4480245fafdd","resolution":{"observed_at":"2026-08-02T06:42:18.867792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:18.969333Z","title":"THE-X: Privacy-preserving transformer inference with homomorphic encryption","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:18.969333Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:ca0cfe056feec81167b5d9a76649cd55f900867eb572ff927eaf2471f28e20ce","observation_id":"e05b9057-df30-4519-a95a-a42138371044","resolution":{"observed_at":"2026-08-02T06:42:18.969333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.083020Z","title":"Xing, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.083020Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:52304311ac98077b5191c5a20197ee6546c37fae0279b9ec3c86ff1ae978fa33","observation_id":"5369bbcc-5885-4905-9e6a-cf607f584081","resolution":{"observed_at":"2026-08-02T06:42:19.083020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.164171Z","title":"Secureinfer: Heterogeneous TEE-GPU architecture for privacy- critical LLM tensors.arXiv preprint arXiv:2510.19979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.164171Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:fa1d7e25d05ab1c8b5390a9945f3e7a49bb706ad3047892d6f6129f690008899","observation_id":"223d5a16-0e04-49b4-8373-640f5860107b","resolution":{"observed_at":"2026-08-02T06:42:19.164171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.238337Z","title":"ONNX Runtime: Cross-platform, high performance machine learning inferencing and training accelerator.https://onnxruntime.ai/","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.238337Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:3a690f91f390a820cf72639356d30df05de58891c58241b540eaee9199eb71f7","observation_id":"31bfd236-2284-4e7d-970a-f89636aeddf0","resolution":{"observed_at":"2026-08-02T06:42:19.238337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10505","last_updated":"2022-09-21T17:05:12Z","snapshot_observed_at":"2026-07-06T13:54:49.290065Z","submitted_at":"2022-09-21T17:05:12Z","title":"Text Revealer: Private Text Reconstruction via Model Inversion Attacks against Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10505","snapshot_observed_at":"2026-08-02T06:42:19.309412Z","title":"Text revealer: Private text reconstruction via model inversion attacks against transformers.arXiv preprint arXiv:2209.10505, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.309412Z"},"links":{"cited_paper":"/paper/2209.10505","citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:6747250c5eacedaabbf7470f36e0c48f5b165fd4c6d4582940c98f2a7b697da4","observation_id":"02d45801-cac2-4a28-b676-337714cc26d7","resolution":{"observed_at":"2026-08-02T06:42:19.309412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.410428Z","title":"ML-Doctor: Holistic risk assessment of inference attacks against machine learning models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.410428Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:f2c09d1e4e4c9d47daac69646cdbb4f78e467b79be821e56300a3d33df95ea33","observation_id":"555f580a-0501-459e-bbc7-4be1bc3da1d2","resolution":{"observed_at":"2026-08-02T06:42:19.410428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.565403Z","title":"Privacy side channels in machine learning systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.565403Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:edb263f261db07835c40be9f4e8429eb1c4f30ccdb80725998d267f56725d9d2","observation_id":"b3620fcb-bd28-4f09-92f5-16b6b7356dd0","resolution":{"observed_at":"2026-08-02T06:42:19.565403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.737748Z","title":"Secure multi-party computation for machine learning: A survey.IEEE Communications Surveys & Tutorials, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.737748Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:482e078426fc1e9bbaf467b51cdcb0862f9293d2b1635e3d9a60a4ed3ba5be08","observation_id":"f26177c0-e00f-4545-a5fe-dece69615396","resolution":{"observed_at":"2026-08-02T06:42:19.737748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:42:19.865695Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T06:42:19.865695Z"},"links":{"citing_paper":"/paper/2607.13093"},"observation_digest":"sha256:7533c7d1be81c48968297689163c6d6b335b5275196dcc484bfb374ef2e3c3e6","observation_id":"a2cb37e2-5ef6-48ae-8838-00b7e3d2b366","resolution":{"observed_at":"2026-08-02T06:42:19.865695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13093","last_updated":"2026-07-14T01:17:17Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T10:48:10.083642Z","submitted_at":"2026-07-14T01:17:17Z","title":"Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.13093."}