{"as_of":"2026-08-09T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ee21608e25aec5141d0efc60ba85ad516503abfbf25e89569957ef304290c29","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:38:34.613440Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00573/citation-record","integrity":"/paper/2608.00573/integrity","json":"/paper/2608.00573/citation-record.json","paper":"/paper/2608.00573"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:42.706843Z","title":"A survey of large language models,","venue":null,"work_id":"59b40cfe-9b6d-4c7a-8a3a-b242e6127546","year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.330024Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:1a5ca328cfb5a48f424ff01507d51cf3cb856740b20758d1985f7512d5ac6cda","observation_id":"8d7ae9ad-b54b-4efa-9281-98f38b6faa86","resolution":{"observed_at":"2026-08-05T00:38:42.886638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T00:38:31.388278Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.388278Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:8045b000b87bdd9f024501a61016bae0c6b72008ee4fdb28a43fe9670301de00","observation_id":"2d4840ae-6aef-4374-a407-b987a9ca8b16","resolution":{"observed_at":"2026-08-05T00:38:31.388278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:42.448644Z","title":"A r e v i e w o n edge large language models: Design, execution, and applications,","venue":null,"work_id":"3cf07981-4897-4fb3-a8bf-d1cc346b704c","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.484969Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:e8f06e8b548b7216438d081a8e70371aa6cc77e90ed2ec627669cbc79d492aab","observation_id":"2d9aa3ed-80f5-4761-b047-9d0c8d24a460","resolution":{"observed_at":"2026-08-05T00:38:42.568407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T00:38:31.525309Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.525309Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:beae72cf0b94178259408c2e73027ee3b6687d6aee722a75a101fcec44b3a1d2","observation_id":"e2192732-d85c-4113-ace8-6b0cbb766eee","resolution":{"observed_at":"2026-08-05T00:38:31.525309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:42.263325Z","title":"A survey on mixture of experts in large language models,","venue":null,"work_id":"72a1172d-9756-45ac-b4d4-9092488f54fa","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.626229Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:247b02b15bf6664824f4f5afb54c16cb9252305dae504017f18c8fbb8cc90d68","observation_id":"53e939e6-2b49-4836-9e82-23e60544b5b7","resolution":{"observed_at":"2026-08-05T00:38:42.346021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.949847Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":"5895ae9f-057d-4520-8ded-a811aa7d6f48","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.672131Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:567760287debcdf3ab383e08eaae41a8ae3efefbeb04f0fc31f8dcf6f8cdd670","observation_id":"459e3e6c-78bf-4299-8094-a87c65d19232","resolution":{"observed_at":"2026-08-05T00:38:42.137523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.636181Z","title":"LLM-Pruner: On the structural pruning of large language models,","venue":null,"work_id":"3f16a876-794a-4134-b99b-16530bff00eb","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.748600Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:c4bdee1075d114bdb6bcac56ccb28cc0bf51d0a84171591a34ce9718a8efbebf","observation_id":"54d2ccd7-bba8-4829-bb87-0f400defa195","resolution":{"observed_at":"2026-08-05T00:38:41.798322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.339980Z","title":"Survey on knowledge distillation for large language models: Methods, Evaluation, and Application,","venue":null,"work_id":"4674f082-7e68-4b98-bc35-dd3e4650e8a8","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.870509Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:dfd51fe40c4ffe127fd074c46a21d12b4280c458cd557e203a555a9afa2d802d","observation_id":"dd546f79-522e-4c4f-957d-85572b4e236a","resolution":{"observed_at":"2026-08-05T00:38:41.498721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.107896Z","title":"SVD-LLM: Truncation-aware singular value decomposition for large language model compression,","venue":null,"work_id":"1a838050-3344-4ea9-b2c8-27903cea71e3","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.951191Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:59ec1b75e1161bcbc155015b9ab3d4f3764f42cd8827057cca8854ba92d1d1a4","observation_id":"ef5bf46e-91f5-4947-8eab-669f6f87a7b1","resolution":{"observed_at":"2026-08-05T00:38:41.238043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:40.800228Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"4f947fc3-a07b-499c-8aa5-acb607dd73a6","year":2022},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.001606Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:f2aef749fbf19fad3df6448df220619ae5bf1079aaf2a609267768a5eae5ee16","observation_id":"521d492e-3e88-484e-99af-c524f140c884","resolution":{"observed_at":"2026-08-05T00:38:40.963149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:40.454583Z","title":"LLM in a flash: Efficient large language model inference with limited memory,","venue":null,"work_id":"c759a147-0175-40ae-b969-7edb0b5fea4f","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.104998Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:a6e29732a23b39e4d1ebcb756986f76067bbcfcdd6b0a25afa9363497c817a52","observation_id":"87543faf-941a-48f2-b23b-e9e960d070ac","resolution":{"observed_at":"2026-08-05T00:38:40.632302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:40.164239Z","title":"EdgeShard: Efficient large language model inference via collaborative edge computing,","venue":null,"work_id":"a83e4c41-a195-4b9a-b1ed-da0a841160f3","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.208493Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:88f87a2542b50a511a565cfe721879655b88abb774d1c08316c2b834f6ad9e51","observation_id":"9c2bd2a0-375d-4e93-af10-e72fc1b81545","resolution":{"observed_at":"2026-08-05T00:38:40.280304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.920561Z","title":"AlpaServe: Statistical multiplexing with model parallelism for deep learning serving,","venue":null,"work_id":"e7bc008b-f237-47f2-845f-1ce7a59be985","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.315233Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:b2b3e4ee11ffe71063c990317ee2765920649b11bd8a953b476f15c10f059056","observation_id":"4fa64280-f3dc-4b34-8e3b-9a07fa0523de","resolution":{"observed_at":"2026-08-05T00:38:40.051474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.736889Z","title":"Orca: A distributed serving system for transformer-based generative models,","venue":null,"work_id":"a3f1a7d0-4377-4792-a8c9-3111e99fcce8","year":2022},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.450349Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:36b70ad2bc5575b72e3c0f50944929408f165850b708c4217983cc33d5c089d3","observation_id":"f50a6135-ca1d-4e6d-9f19-401c862ee956","resolution":{"observed_at":"2026-08-05T00:38:39.803090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T00:38:32.536971Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.536971Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:f1b75674dbad481b522a1f4791f0e5c1211d8bc97a7ed9176a9fec74542ad880","observation_id":"0f7a89d8-d880-470f-97a2-fcc20d3834de","resolution":{"observed_at":"2026-08-05T00:38:32.536971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.483509Z","title":"RDMA over commodity Ethernet at scale,","venue":null,"work_id":"e229455a-8b62-49f2-ad73-569388129ccb","year":2016},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.638032Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:9f7efd0b78d1afcfc8e8de6a644582c69c6c63cde5a429d5455c8641249b27c5","observation_id":"46348b97-727c-4a79-9967-4b6f7e0bb972","resolution":{"observed_at":"2026-08-05T00:38:39.585942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:32.753954Z","title":"An introduction to the InfiniBand architecture,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.753954Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:de7d1db9347a7bae06899ad98ace4656b02351728eac542ebaa758283dc58dbd","observation_id":"44ef7923-2372-496c-82d6-91a60c3b09bc","resolution":{"observed_at":"2026-08-05T00:38:32.753954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.224250Z","title":"A s u r v e y o n mobile edge computing: The communication perspective,","venue":null,"work_id":"1fd98039-2ec3-4222-a3eb-18660530c4d1","year":2017},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.861187Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:3bb8f510b1b0a809f28f4d6fa9b7bb6a6445fce6a65a05a0d9598c35a2974b36","observation_id":"84e203cd-d350-4de0-b404-fd74ccc9c014","resolution":{"observed_at":"2026-08-05T00:38:39.403446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.988254Z","title":"Resource management in mobile edge computing: A comprehensive survey,","venue":null,"work_id":"db4d5c27-03d0-4d4d-bcc7-739e356ba712","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.933426Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:f8471efda259885d7863018256066435a7d2d2789772165671dd8be0cbf7655f","observation_id":"36ea87fd-59ad-49ea-9070-0a610e369e95","resolution":{"observed_at":"2026-08-05T00:38:39.097063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.778336Z","title":"ShortGPT: Layers in large language models are more redundant than you expect,","venue":null,"work_id":"b1a2384e-0938-43dc-984b-a5c2e29c19cb","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.027478Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:d30852135b603831c62047a90d4abe61e5401ada0153d2f4944197bb5a7143d1","observation_id":"b9515deb-db61-482b-b323-01c16bae3396","resolution":{"observed_at":"2026-08-05T00:38:38.874283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T00:38:33.123606Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.123606Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:38ad344a6acce91c226fac7ffd762e0dba71a7983d50990da627e83d62620bbc","observation_id":"753b345f-f689-4ed1-ad0f-69a2f409a63a","resolution":{"observed_at":"2026-08-05T00:38:33.123606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.527057Z","title":"Confident adaptive language modeling,","venue":null,"work_id":"e083bdd2-db99-4b98-8234-98f1612b66d5","year":2022},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.234639Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:219d71a1851779d7ce48e9a64e6be56e7ab35f8ecf87f92eab0e7528d89931ce","observation_id":"8a0b6591-ef63-419c-ad9b-aed443d82483","resolution":{"observed_at":"2026-08-05T00:38:38.647171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.248001Z","title":"Distributed inference acceleration with adaptive DNN partitioning and offloading,","venue":null,"work_id":"6de4453a-4f8a-4086-be7c-5273175b1575","year":2020},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.305344Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:113a8a19554119dd2058d416a66b63336788eca8ae970f90e0b663bf2368f015","observation_id":"805ae9a7-f875-40f0-82b1-cb1d88333de3","resolution":{"observed_at":"2026-08-05T00:38:38.412246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.952425Z","title":"PArtNNer: Platform-agnostic adaptive edge-cloud DNN partitioning for minimizing end-to-end latency,","venue":null,"work_id":"379be93d-fd00-40f4-91dc-2bc9047865fb","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.388043Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:910042f4968d97531bcf90f22814f8e1d28c50a7f28e007a63bb1b8b52325b80","observation_id":"7233bfc1-61f9-4736-a0d2-cbde283a5ca4","resolution":{"observed_at":"2026-08-05T00:38:38.131115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.689839Z","title":"S p l i t c o m p u t i n g a n d e a r l y exiting for deep learning applications: Survey and research challenges,","venue":null,"work_id":"5848b53e-c922-4ea0-a996-9a8b7efb2e1e","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.440549Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:8f32ac5670398b413842ecdcb90e215a2d92224dbc240b45af782dce6c2a9e35","observation_id":"9b080fcb-dda9-4997-8648-588be100f938","resolution":{"observed_at":"2026-08-05T00:38:37.815336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.515920Z","title":"Edge-LLM: A collaborative framework for large language model serving in edge computing,","venue":null,"work_id":"f58da29f-5095-4722-9215-60cbc890b6cd","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.524558Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:97ae837a6360217cd2070917015e17d7b445352e990d7a7d16b5647bb953572b","observation_id":"9e01e4d3-3393-4941-904b-8b230c30bb92","resolution":{"observed_at":"2026-08-05T00:38:37.615515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.248180Z","title":"Communication-efficient distributed on-device LLM inference over wireless networks,","venue":null,"work_id":"d74fb0a2-e3b9-4a36-aefd-4b3b1377b02f","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.639597Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:13f0ab84e5f5f644fd1f053678cf112b0690c10c0376c25f9222cb9989601566","observation_id":"ad7fe097-11bc-4738-a79e-ffbe609a5bf3","resolution":{"observed_at":"2026-08-05T00:38:37.361030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.960103Z","title":"Jupiter: Fast and resource-efficient collaborative inference of generative LLMs on edge devices,","venue":null,"work_id":"dc211086-d666-4cbe-9836-442f7eb3d4a0","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.753085Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:c3bc6199648192c9e80209cac53bab93d2b74dd0bf4c2f24cd378e5fe4b2ce64","observation_id":"ced3409a-c84b-40fc-933c-5fc316b991b8","resolution":{"observed_at":"2026-08-05T00:38:37.104600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.589003Z","title":"AdapMoE: Adaptive sensitivity-based expert gating and management for efficient MoE inference,","venue":null,"work_id":"483845ae-8666-4c18-83e2-346a31b24ec5","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.875625Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:c922a1aaa95035cea48ac306eafb7cc7799835592e05c29165ef858a610814dd","observation_id":"aa09ac28-2974-40a1-982a-8aa8076ab7e0","resolution":{"observed_at":"2026-08-05T00:38:36.733654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.348132Z","title":"SlimCaching: Edge caching of mixture-of-experts for distributed inference,","venue":null,"work_id":"95017ff4-37de-4be8-88b1-c318a29e4edd","year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.022256Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:212237d3f7e38007ba293a86b5666d704e5737ba8856c541f58c225bc82877c9","observation_id":"83cd0344-0fb0-49a7-add1-1537717d61ce","resolution":{"observed_at":"2026-08-05T00:38:36.435395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.125805Z","title":"Diff-MoE: Efficient batched MoE inference with priority-driven differential expert caching,","venue":null,"work_id":"a223df11-9fb6-430c-b96c-aac58f60ecc5","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.066116Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:f4d556ed6436b843850a9a839b978e88dd24e713373f51c09e7253776ebb136c","observation_id":"79f1687b-6155-4708-ac53-32a88bc8e88f","resolution":{"observed_at":"2026-08-05T00:38:36.205313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:34.139685Z","title":"PROBE: Co-balancing computation and communication in MoE inference via real-time predictive prefetching,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.139685Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:e2702b0fd72cd3422b3e961fc6b640c87be4d3d0bfffe6d550eead1df88c8b2a","observation_id":"3f76cdf2-7178-4ab3-b2a1-df8c59585127","resolution":{"observed_at":"2026-08-05T00:38:34.139685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:35.757966Z","title":"MegaScale-Infer: Efficient mixture-of-experts model serving with disaggregated expert parallelism,","venue":null,"work_id":"c7889c59-36f5-4f4f-b28d-f4e5de17d9a0","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.189133Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:3126dc806b17e4f5a415f6156ed40912fdb54f37d8c208b1deefe8dc79e16038","observation_id":"4b6c08dc-e58d-4ab0-801c-51ebfa7784e9","resolution":{"observed_at":"2026-08-05T00:38:35.968662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:35.472188Z","title":"WDMoE: Wireless distributed mixture of experts for large language models,","venue":null,"work_id":"1f074308-86c9-4d5a-b6e8-eac73aa6f0e2","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.294312Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:f978da663e97995a18e4b083007c59aa7801320d21d00437b5b56de8ac96bcff","observation_id":"42ffc3c9-37fe-4b96-966e-51f854f9c016","resolution":{"observed_at":"2026-08-05T00:38:35.609792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:35.260316Z","title":"MoE2: Optimizing collaborative inference for edge large language models,","venue":null,"work_id":"0a178549-74e5-498f-8508-08fd174e5896","year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.399556Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:3ab54a38638e772b36d2b74c171d9b0902fbbc11b6135607dfa74d9e2df57fd4","observation_id":"ec2343cc-536f-40ac-a424-5c8d8622fec8","resolution":{"observed_at":"2026-08-05T00:38:35.349564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:34.962687Z","title":"LayerSkip: Enabling early exit inference and self-speculative decoding,","venue":null,"work_id":"8c0c05b7-d3a3-4d07-98ff-6a7f6a44c925","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.478267Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:58c92ea817e70091b5d476bfe4b510c484bed3e6aadb34644057ebf4f035beaa","observation_id":"58bab9cb-5ae7-4b69-a1e6-c66281a1cc64","resolution":{"observed_at":"2026-08-05T00:38:35.118909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.17154","last_updated":"2026-07-19T09:20:21Z","snapshot_observed_at":"2026-08-09T05:23:39.588966Z","submitted_at":"2026-07-19T09:20:21Z","title":"OrderMoE: An expert similarity driven distributed edge MoE inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.17154","snapshot_observed_at":"2026-08-05T00:38:34.613440Z","title":"OrderMoE: An Expert Similarity Driven Distributed Edge MoE Inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.613440Z"},"links":{"cited_paper":"/paper/2607.17154","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:08500680b503f6416d0d94e9b223482a41cd7784af4d88e40b4ad41ce9b76bab","observation_id":"91d0d88d-1bfb-44de-b5cd-6a351b33cabf","resolution":{"observed_at":"2026-08-05T00:38:34.613440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","latest_version":1,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2608.00573."}