{"as_of":"2026-08-10T14:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f41cf62f3e8673452e21dae0d302f8874eaeb57bd8e520cce29991b0cfa06e7","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:38:34.613440Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00573/citation-record","integrity":"/paper/2608.00573/integrity","json":"/paper/2608.00573/citation-record.json","paper":"/paper/2608.00573"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:42.706843Z","title":"A survey of large language models,","venue":null,"work_id":"59b40cfe-9b6d-4c7a-8a3a-b242e6127546","year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.330024Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:958567ca6097932bfb091833c649429c38fa9965bbd0de7324f516247d4efb10","observation_id":"8d7ae9ad-b54b-4efa-9281-98f38b6faa86","resolution":{"observed_at":"2026-08-05T00:38:42.886638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T00:38:31.388278Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.388278Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:8045b000b87bdd9f024501a61016bae0c6b72008ee4fdb28a43fe9670301de00","observation_id":"2d4840ae-6aef-4374-a407-b987a9ca8b16","resolution":{"observed_at":"2026-08-05T00:38:31.388278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:42.448644Z","title":"A r e v i e w o n edge large language models: Design, execution, and applications,","venue":null,"work_id":"3cf07981-4897-4fb3-a8bf-d1cc346b704c","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.484969Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:331d07b8cabf0ea8450b55817b7fa7e899ad2700b0bca40fb0b97cf19872c9a0","observation_id":"2d9aa3ed-80f5-4761-b047-9d0c8d24a460","resolution":{"observed_at":"2026-08-05T00:38:42.568407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T00:38:31.525309Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.525309Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:beae72cf0b94178259408c2e73027ee3b6687d6aee722a75a101fcec44b3a1d2","observation_id":"e2192732-d85c-4113-ace8-6b0cbb766eee","resolution":{"observed_at":"2026-08-05T00:38:31.525309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:42.263325Z","title":"A survey on mixture of experts in large language models,","venue":null,"work_id":"72a1172d-9756-45ac-b4d4-9092488f54fa","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.626229Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:c18cdb6db3c75bf0451cbf5be7db96960a891558f39df65c3947704780934cdb","observation_id":"53e939e6-2b49-4836-9e82-23e60544b5b7","resolution":{"observed_at":"2026-08-05T00:38:42.346021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.949847Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":"5895ae9f-057d-4520-8ded-a811aa7d6f48","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.672131Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:163954697b3b7a0447eb9a9055e83fd52469249361859076849472e2ccc482de","observation_id":"459e3e6c-78bf-4299-8094-a87c65d19232","resolution":{"observed_at":"2026-08-05T00:38:42.137523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.636181Z","title":"LLM-Pruner: On the structural pruning of large language models,","venue":null,"work_id":"3f16a876-794a-4134-b99b-16530bff00eb","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.748600Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:ed8d61c5ec8dbe8b8a2546c1ddec0a75093265f3611b543060e3dbd56298c3c1","observation_id":"54d2ccd7-bba8-4829-bb87-0f400defa195","resolution":{"observed_at":"2026-08-05T00:38:41.798322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.339980Z","title":"Survey on knowledge distillation for large language models: Methods, Evaluation, and Application,","venue":null,"work_id":"4674f082-7e68-4b98-bc35-dd3e4650e8a8","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.870509Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:284576a24292f5f01bd04555e3514335132d13acb0cd5d25b110ac3f6b714fc0","observation_id":"dd546f79-522e-4c4f-957d-85572b4e236a","resolution":{"observed_at":"2026-08-05T00:38:41.498721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:41.107896Z","title":"SVD-LLM: Truncation-aware singular value decomposition for large language model compression,","venue":null,"work_id":"1a838050-3344-4ea9-b2c8-27903cea71e3","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:31.951191Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:aec5db763f3f4170308879d443de45b6630bd35737b25a5e551167de5f5c337b","observation_id":"ef5bf46e-91f5-4947-8eab-669f6f87a7b1","resolution":{"observed_at":"2026-08-05T00:38:41.238043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:40.800228Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":"4f947fc3-a07b-499c-8aa5-acb607dd73a6","year":2022},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.001606Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:69f44442d787a463abb3d8853b5153c173b069c0ab4787a856abfb7b4f64809c","observation_id":"521d492e-3e88-484e-99af-c524f140c884","resolution":{"observed_at":"2026-08-05T00:38:40.963149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:40.454583Z","title":"LLM in a flash: Efficient large language model inference with limited memory,","venue":null,"work_id":"c759a147-0175-40ae-b969-7edb0b5fea4f","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.104998Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:09864160bcd0d26c5d0a1c8862ae9ad6e1892222a6f1e773c6e83c2cd5fbc430","observation_id":"87543faf-941a-48f2-b23b-e9e960d070ac","resolution":{"observed_at":"2026-08-05T00:38:40.632302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:40.164239Z","title":"EdgeShard: Efficient large language model inference via collaborative edge computing,","venue":null,"work_id":"a83e4c41-a195-4b9a-b1ed-da0a841160f3","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.208493Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:22799de490cc8e683a3d84790f147ebec66b10f5eb7fe6895512a14079fe582d","observation_id":"9c2bd2a0-375d-4e93-af10-e72fc1b81545","resolution":{"observed_at":"2026-08-05T00:38:40.280304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.920561Z","title":"AlpaServe: Statistical multiplexing with model parallelism for deep learning serving,","venue":null,"work_id":"e7bc008b-f237-47f2-845f-1ce7a59be985","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.315233Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:1e739c853446161e6b736f185490ca3593a574a613155f7d9d39786f6890c549","observation_id":"4fa64280-f3dc-4b34-8e3b-9a07fa0523de","resolution":{"observed_at":"2026-08-05T00:38:40.051474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.736889Z","title":"Orca: A distributed serving system for transformer-based generative models,","venue":null,"work_id":"a3f1a7d0-4377-4792-a8c9-3111e99fcce8","year":2022},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.450349Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:93b23a8de2f6d21e4d0eda41bf67d5ba756b89cdaa8fe910c71100e69e752d35","observation_id":"f50a6135-ca1d-4e6d-9f19-401c862ee956","resolution":{"observed_at":"2026-08-05T00:38:39.803090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T00:38:32.536971Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.536971Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:f1b75674dbad481b522a1f4791f0e5c1211d8bc97a7ed9176a9fec74542ad880","observation_id":"0f7a89d8-d880-470f-97a2-fcc20d3834de","resolution":{"observed_at":"2026-08-05T00:38:32.536971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.483509Z","title":"RDMA over commodity Ethernet at scale,","venue":null,"work_id":"e229455a-8b62-49f2-ad73-569388129ccb","year":2016},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.638032Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:c5a4c4757f221006c62019a99805920fe1ad3c2d8f01d065ce154939371eba91","observation_id":"46348b97-727c-4a79-9967-4b6f7e0bb972","resolution":{"observed_at":"2026-08-05T00:38:39.585942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:32.753954Z","title":"An introduction to the InfiniBand architecture,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.753954Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:de7d1db9347a7bae06899ad98ace4656b02351728eac542ebaa758283dc58dbd","observation_id":"44ef7923-2372-496c-82d6-91a60c3b09bc","resolution":{"observed_at":"2026-08-05T00:38:32.753954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:39.224250Z","title":"A s u r v e y o n mobile edge computing: The communication perspective,","venue":null,"work_id":"1fd98039-2ec3-4222-a3eb-18660530c4d1","year":2017},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.861187Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:682f556bf766c393a1374a767261103c03f3dca3d7b74a76ff5fd988f2d3b328","observation_id":"84e203cd-d350-4de0-b404-fd74ccc9c014","resolution":{"observed_at":"2026-08-05T00:38:39.403446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.988254Z","title":"Resource management in mobile edge computing: A comprehensive survey,","venue":null,"work_id":"db4d5c27-03d0-4d4d-bcc7-739e356ba712","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:32.933426Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:31cb915436620ddf1c8eb7e713d20c3c6ef5ef04cc64427132fb1eb09f2ef4b5","observation_id":"36ea87fd-59ad-49ea-9070-0a610e369e95","resolution":{"observed_at":"2026-08-05T00:38:39.097063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.778336Z","title":"ShortGPT: Layers in large language models are more redundant than you expect,","venue":null,"work_id":"b1a2384e-0938-43dc-984b-a5c2e29c19cb","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.027478Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:0ed43b44ea0436f8c3897411f6f70016e7334a1eb8af75d47c680da3b10f094b","observation_id":"b9515deb-db61-482b-b323-01c16bae3396","resolution":{"observed_at":"2026-08-05T00:38:38.874283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-05T00:38:33.123606Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.123606Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:38ad344a6acce91c226fac7ffd762e0dba71a7983d50990da627e83d62620bbc","observation_id":"753b345f-f689-4ed1-ad0f-69a2f409a63a","resolution":{"observed_at":"2026-08-05T00:38:33.123606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.527057Z","title":"Confident adaptive language modeling,","venue":null,"work_id":"e083bdd2-db99-4b98-8234-98f1612b66d5","year":2022},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.234639Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:2d09d76ff1808f7b99f9185504e6f1e4cef3dabd26d21eb42fb8bcaec6b75430","observation_id":"8a0b6591-ef63-419c-ad9b-aed443d82483","resolution":{"observed_at":"2026-08-05T00:38:38.647171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:38.248001Z","title":"Distributed inference acceleration with adaptive DNN partitioning and offloading,","venue":null,"work_id":"6de4453a-4f8a-4086-be7c-5273175b1575","year":2020},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.305344Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:b18bd5c8b132b83f66967de5a454c6407a9d27a6fe18f6fe21ae506f1b30898b","observation_id":"805ae9a7-f875-40f0-82b1-cb1d88333de3","resolution":{"observed_at":"2026-08-05T00:38:38.412246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.952425Z","title":"PArtNNer: Platform-agnostic adaptive edge-cloud DNN partitioning for minimizing end-to-end latency,","venue":null,"work_id":"379be93d-fd00-40f4-91dc-2bc9047865fb","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.388043Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:fa9e131783e3e83b82f5c7e135585c4c3926a554949fd7470b5c7406fc2a1d73","observation_id":"7233bfc1-61f9-4736-a0d2-cbde283a5ca4","resolution":{"observed_at":"2026-08-05T00:38:38.131115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.689839Z","title":"S p l i t c o m p u t i n g a n d e a r l y exiting for deep learning applications: Survey and research challenges,","venue":null,"work_id":"5848b53e-c922-4ea0-a996-9a8b7efb2e1e","year":2023},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.440549Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:10f5e9e9ce02f708735ed9765fc96669b443011cfae942a6183b6bb37459d024","observation_id":"9b080fcb-dda9-4997-8648-588be100f938","resolution":{"observed_at":"2026-08-05T00:38:37.815336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.515920Z","title":"Edge-LLM: A collaborative framework for large language model serving in edge computing,","venue":null,"work_id":"f58da29f-5095-4722-9215-60cbc890b6cd","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.524558Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:a9af8d1efcead217db957a0aedf39e8ed445e9a376e6a175ceaf94bc10abe8d4","observation_id":"9e01e4d3-3393-4941-904b-8b230c30bb92","resolution":{"observed_at":"2026-08-05T00:38:37.615515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:37.248180Z","title":"Communication-efficient distributed on-device LLM inference over wireless networks,","venue":null,"work_id":"d74fb0a2-e3b9-4a36-aefd-4b3b1377b02f","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.639597Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:825b25d5bbb049f0056c0249d8e93f884fca0f859e51cbd1ab671683fec6913e","observation_id":"ad7fe097-11bc-4738-a79e-ffbe609a5bf3","resolution":{"observed_at":"2026-08-05T00:38:37.361030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.960103Z","title":"Jupiter: Fast and resource-efficient collaborative inference of generative LLMs on edge devices,","venue":null,"work_id":"dc211086-d666-4cbe-9836-442f7eb3d4a0","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.753085Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:71ebcc2da29b80e161a324e6d550f0d9fd2a1ca9db4f88c93dade729e7398187","observation_id":"ced3409a-c84b-40fc-933c-5fc316b991b8","resolution":{"observed_at":"2026-08-05T00:38:37.104600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.589003Z","title":"AdapMoE: Adaptive sensitivity-based expert gating and management for efficient MoE inference,","venue":null,"work_id":"483845ae-8666-4c18-83e2-346a31b24ec5","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:33.875625Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:270c42f423a4b6834a7a2881e9e12c1815fc06693fbaae65803554c3f9139c57","observation_id":"aa09ac28-2974-40a1-982a-8aa8076ab7e0","resolution":{"observed_at":"2026-08-05T00:38:36.733654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.348132Z","title":"SlimCaching: Edge caching of mixture-of-experts for distributed inference,","venue":null,"work_id":"95017ff4-37de-4be8-88b1-c318a29e4edd","year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.022256Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:356fdcaabf5b6c50bf78af850025b6f56d1544442c56478c1737b6619401bcd0","observation_id":"83cd0344-0fb0-49a7-add1-1537717d61ce","resolution":{"observed_at":"2026-08-05T00:38:36.435395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:36.125805Z","title":"Diff-MoE: Efficient batched MoE inference with priority-driven differential expert caching,","venue":null,"work_id":"a223df11-9fb6-430c-b96c-aac58f60ecc5","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.066116Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:8463426ce5fbef3288c159a4ff2aa96d81cc496c8697a1a6867198e73fb73c66","observation_id":"79f1687b-6155-4708-ac53-32a88bc8e88f","resolution":{"observed_at":"2026-08-05T00:38:36.205313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:34.139685Z","title":"PROBE: Co-balancing computation and communication in MoE inference via real-time predictive prefetching,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.139685Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:e2702b0fd72cd3422b3e961fc6b640c87be4d3d0bfffe6d550eead1df88c8b2a","observation_id":"3f76cdf2-7178-4ab3-b2a1-df8c59585127","resolution":{"observed_at":"2026-08-05T00:38:34.139685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:35.757966Z","title":"MegaScale-Infer: Efficient mixture-of-experts model serving with disaggregated expert parallelism,","venue":null,"work_id":"c7889c59-36f5-4f4f-b28d-f4e5de17d9a0","year":2025},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.189133Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:43d582cdf4b7ffde3467a16a8d32c43b331a25ccc0b13df629ff0d6d73ae8419","observation_id":"4b6c08dc-e58d-4ab0-801c-51ebfa7784e9","resolution":{"observed_at":"2026-08-05T00:38:35.968662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:35.472188Z","title":"WDMoE: Wireless distributed mixture of experts for large language models,","venue":null,"work_id":"1f074308-86c9-4d5a-b6e8-eac73aa6f0e2","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.294312Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:dce3ae8e6e758328a9a9787f288709095bec853486f4a5ed01c43148a4738047","observation_id":"42ffc3c9-37fe-4b96-966e-51f854f9c016","resolution":{"observed_at":"2026-08-05T00:38:35.609792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:35.260316Z","title":"MoE2: Optimizing collaborative inference for edge large language models,","venue":null,"work_id":"0a178549-74e5-498f-8508-08fd174e5896","year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.399556Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:119b6a226a3219ea952462daef36c2cf3682d86716b1c73425fabd9ad63a7e88","observation_id":"ec2343cc-536f-40ac-a424-5c8d8622fec8","resolution":{"observed_at":"2026-08-05T00:38:35.349564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:38:34.962687Z","title":"LayerSkip: Enabling early exit inference and self-speculative decoding,","venue":null,"work_id":"8c0c05b7-d3a3-4d07-98ff-6a7f6a44c925","year":2024},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.478267Z"},"links":{"citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:3ae1b98e86d5e5c7e576979924f2ccf36e3da482d6e88e3fbd59841be86253d1","observation_id":"58bab9cb-5ae7-4b69-a1e6-c66281a1cc64","resolution":{"observed_at":"2026-08-05T00:38:35.118909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.17154","last_updated":"2026-07-19T09:20:21Z","snapshot_observed_at":"2026-08-10T04:15:17.539541Z","submitted_at":"2026-07-19T09:20:21Z","title":"OrderMoE: An expert similarity driven distributed edge MoE inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.17154","snapshot_observed_at":"2026-08-05T00:38:34.613440Z","title":"OrderMoE: An Expert Similarity Driven Distributed Edge MoE Inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T00:38:34.613440Z"},"links":{"cited_paper":"/paper/2607.17154","citing_paper":"/paper/2608.00573"},"observation_digest":"sha256:87c761f660ffa8c7234262360a9ac6de5c32b6d5b6ef721eac24f482752ba73b","observation_id":"91d0d88d-1bfb-44de-b5cd-6a351b33cabf","resolution":{"observed_at":"2026-08-05T00:38:34.613440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00573","last_updated":"2026-08-01T10:19:02Z","latest_version":1,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-06T23:17:28.405762Z","submitted_at":"2026-08-01T10:19:02Z","title":"TrimMoE A communication aware and adaptive depth framework for distributed edge inference"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2608.00573."}