{"as_of":"2026-08-09T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d61555b0e6c3b0b7a4b3da8f4f9779d9259aea197b358d1d4ef6f055e702436","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:55:54.162523Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:39.550340Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-08T17:55:54.162523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.162523Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:cbb52b2414359137ac7d50294fd7ec7ba41831ef9caf4e9774166027cb2db890","observation_id":"6e448380-db6b-4462-b9ba-53343266b24c","resolution":{"observed_at":"2026-08-08T17:55:54.162523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2508.12851","last_updated":"2026-04-15T14:22:25Z","snapshot_observed_at":"2026-07-06T22:14:25.511807Z","submitted_at":"2025-08-18T11:41:17Z","title":"Accelerating Edge Inference for Distributed MoE Models with Latency-Optimized Expert Placement","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T22:52:39.416575Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2508.12851"},"observation_digest":"sha256:0f8444bf74428720a8cd10c1af023cd7b53c63fce08c962fa999ecaf3e1082d0","observation_id":"07f98ea7-7877-4bc3-bf7e-72b0de36a718","resolution":{"observed_at":"2026-05-18T22:52:51.896416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-05T17:03:42.658889Z","title":"https://arxiv.org/abs/2401.14361","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17137","last_updated":"2025-08-23T20:28:32Z","snapshot_observed_at":"2026-08-09T05:24:12.653759Z","submitted_at":"2025-08-23T20:28:32Z","title":"MoE-Beyond: Learning-Based Expert Activation Prediction on Edge Devices","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T17:03:42.658889Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2508.17137"},"observation_digest":"sha256:4de4b800d48d75ef6d939c39493195602855e4edc026291aa72ae604032e6d2b","observation_id":"94c46255-a666-451d-b290-ce5b4aa13816","resolution":{"observed_at":"2026-08-05T17:03:42.658889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2509.07379","last_updated":"2026-04-09T05:45:21Z","snapshot_observed_at":"2026-08-03T01:38:18.698775Z","submitted_at":"2025-09-09T04:00:43Z","title":"DuoServe-MoE: Dual-Phase Expert Prefetch and Caching for LLM Inference QoS Assurance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T18:33:55.795906Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.07379"},"observation_digest":"sha256:1e95efda9b919466ce77d5f8b950b135e4636da3b0191a7d7fa7f9d6e97ee56f","observation_id":"ae163c1c-a6a1-43c3-b44a-7a64dd5ea6a2","resolution":{"observed_at":"2026-05-18T18:36:44.231748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-04T21:51:06.401918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07727","last_updated":"2025-09-09T13:28:41Z","snapshot_observed_at":"2026-08-09T05:23:42.285519Z","submitted_at":"2025-09-09T13:28:41Z","title":"MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T21:51:06.401918Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.07727"},"observation_digest":"sha256:70f8cd27aa69ec350484a9585d514bcb322f6f5a02985fd2fb38d06167741b75","observation_id":"7a2237d3-2723-437f-bcdc-a3fb5ea9870c","resolution":{"observed_at":"2026-08-04T21:51:06.401918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-04T20:55:19.584295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08342","last_updated":"2025-09-10T07:28:24Z","snapshot_observed_at":"2026-08-07T12:35:47.179422Z","submitted_at":"2025-09-10T07:28:24Z","title":"Accelerating Mixture-of-Expert Inference with Adaptive Expert Split Mechanism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:55:19.584295Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.08342"},"observation_digest":"sha256:c0e9d61663ed820fa91a01562f7c41d54be3f22d11fef82f1df2839f0af36946","observation_id":"16a1edf2-a8f0-4291-aec4-96a3df5d55e6","resolution":{"observed_at":"2026-08-04T20:55:19.584295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-02T18:57:31.493788Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:cc71453830fb6010c9324484a6d6cb8eac0c9a36fa9df6a9b0f4449fb1efaeb4","observation_id":"3696400c-f729-49d2-83b5-1c5d6cbeb036","resolution":{"observed_at":"2026-05-18T12:41:22.790153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2601.21198","last_updated":"2026-05-22T06:53:25Z","snapshot_observed_at":"2026-08-09T02:36:25.829599Z","submitted_at":"2026-01-29T02:51:59Z","title":"ZipMoE: Efficient On-Device MoE Serving via Lossless Compression and Cache-Affinity Scheduling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T07:43:24.937953Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2601.21198"},"observation_digest":"sha256:8055230a6173fae22aa532948580321c4a5e7bc26b7425f2599515bfc72aaa0f","observation_id":"050f97cd-542a-4526-96d4-9f81eac3ebd9","resolution":{"observed_at":"2026-05-25T07:45:29.207159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.02715","last_updated":"2026-04-30T13:29:54Z","snapshot_observed_at":"2026-08-06T09:38:08.450828Z","submitted_at":"2026-04-03T04:16:01Z","title":"FluxMoE: Decoupling Expert Residency for High-Performance MoE Serving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T20:16:16.466375Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.02715"},"observation_digest":"sha256:7efad3e287ad339e4418b8f2854df916fb099fbc04d008de6c58391e5bb8199a","observation_id":"da4e28d0-5ecc-43b7-a955-3f4bbfc5c878","resolution":{"observed_at":"2026-05-13T20:18:13.312025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.14626","last_updated":"2026-04-23T01:19:26Z","snapshot_observed_at":"2026-07-06T23:02:22.790426Z","submitted_at":"2026-04-16T05:12:51Z","title":"ELMoE-3D: Leveraging Intrinsic Elasticity of MoE for Hybrid-Bonding-Enabled Self-Speculative Decoding in On-Premises Serving","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T11:28:26.169161Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.14626"},"observation_digest":"sha256:897a94f2d7902958d4b6b7d987e316f1b3b4c3d41ed843af4a01948fdc1b40ff","observation_id":"0f51cc86-66b4-4384-adfd-2d1f08f02b43","resolution":{"observed_at":"2026-05-10T11:30:18.627584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.17182","last_updated":"2026-04-19T00:56:08Z","snapshot_observed_at":"2026-08-03T00:20:06.527897Z","submitted_at":"2026-04-19T00:56:08Z","title":"Layer-wise MoE Routing Locality under Shared-Prefix Code Generation: Token-Identity Decomposition and Compile-Equivalent Fork Redundancy","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T06:46:52.811371Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.17182"},"observation_digest":"sha256:80179c137ceb4d567b526683eff63f3cb4898cb672b8db360baf2d34618313d5","observation_id":"4c43c914-c0c0-44b0-afd7-2ed143816c41","resolution":{"observed_at":"2026-05-10T06:51:46.447419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2604.18788","last_updated":"2026-04-20T19:52:56Z","snapshot_observed_at":"2026-07-31T18:40:43.182032Z","submitted_at":"2026-04-20T19:52:56Z","title":"Efficient Mixture-of-Experts LLM Inference with Apple Silicon NPUs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T05:31:25.826205Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2604.18788"},"observation_digest":"sha256:54294e2a65315a459a6c07e496d625bea085eeb13fbf7977c81f2ddbda0d87c5","observation_id":"5fbd1d3d-e3b1-4435-8059-2abfea64ee3b","resolution":{"observed_at":"2026-05-10T05:36:02.174701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.05899","last_updated":"2026-05-07T09:11:41Z","snapshot_observed_at":"2026-08-05T02:12:24.336765Z","submitted_at":"2026-05-07T09:11:41Z","title":"VisMMOE: Exploiting Visual-Expert Affinity for Efficient Visual-Language MoE Offloading","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T16:10:22.588945Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.05899"},"observation_digest":"sha256:212ef61e056adbefb54478f434e2d42d445b35098768af8309f66875e9cb6b26","observation_id":"794d1f12-71e5-4b83-9186-1f73e578f0ab","resolution":{"observed_at":"2026-05-11T16:36:06.468196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.17889","last_updated":"2026-05-19T04:52:32Z","snapshot_observed_at":"2026-08-03T09:31:25.450040Z","submitted_at":"2026-05-18T05:54:30Z","title":"CoX-MoE: Coalesced Expert Execution for High-Throughput MoE Inference with AMX-Enabled CPU-GPU Co-Execution","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T12:07:53.045082Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.17889"},"observation_digest":"sha256:d91d13bc703838728d66cdf29b3a246fabcf33cfd9926d701f65aee9a6444e49","observation_id":"7a8d0425-079a-4154-afa6-63511dc03319","resolution":{"observed_at":"2026-05-20T12:08:15.396632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.19481","last_updated":"2026-05-19T07:34:08Z","snapshot_observed_at":"2026-08-02T01:46:46.351301Z","submitted_at":"2026-05-19T07:34:08Z","title":"C2CServe: Leveraging NVLink-C2C for Elastic Serverless LLM Serving on MIG","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T02:10:57.582345Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.19481"},"observation_digest":"sha256:8b3b2b5785bb6132f08382950dc67fb65fdd7195261aab6a96ee6e902f458c60","observation_id":"81743ddd-ab30-4031-9717-3c676997fcbc","resolution":{"observed_at":"2026-05-20T02:12:58.326430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2605.20179","last_updated":"2026-05-19T17:59:08Z","snapshot_observed_at":"2026-08-06T13:50:23.608176Z","submitted_at":"2026-05-19T17:59:08Z","title":"TIDE: Efficient and Lossless MoE Diffusion LLM Inference with I/O-aware Expert Offload","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:08:07.318040Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2605.20179"},"observation_digest":"sha256:cd9a8bda917985f2101bc32dafe4e49574002504b8587802c5fb32a5ed8677d9","observation_id":"b4175d1d-845f-4f1c-b391-4bfa1a17e30f","resolution":{"observed_at":"2026-05-20T05:13:03.693206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2606.21428","last_updated":"2026-07-09T17:35:35Z","snapshot_observed_at":"2026-08-08T09:53:30.201517Z","submitted_at":"2026-06-19T13:45:45Z","title":"Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T12:30:55.628115Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21428"},"observation_digest":"sha256:34f206302ccebb2c55e4b5e85980a4c7140fec4b12469d3c9dae7684b145c090","observation_id":"7b1639c6-c879-4556-8598-1c975e26c877","resolution":{"observed_at":"2026-07-04T07:59:39.552150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-12T13:05:17.273287Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21428","last_updated":"2026-07-09T17:35:35Z","snapshot_observed_at":"2026-08-08T09:53:30.201517Z","submitted_at":"2026-06-19T13:45:45Z","title":"Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T13:05:17.273287Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21428"},"observation_digest":"sha256:c6341abff3aaf69017ef7ba163cf886f5bf4a3eafa6b8a569451dabb67b0968c","observation_id":"98e4b80d-de56-429b-b932-23f96c90d71d","resolution":{"observed_at":"2026-07-12T13:05:17.273287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2606.21712","last_updated":"2026-06-19T19:56:21Z","snapshot_observed_at":"2026-08-06T10:39:09.239289Z","submitted_at":"2026-06-19T19:56:21Z","title":"BatchGen: An Architecture for Scalable and Efficient Batch Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-26T12:58:25.319255Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21712"},"observation_digest":"sha256:cbefcc3c519566f0b92aef79003a581175c0618702b4ec6b651e770b1cab8014","observation_id":"7feb9fdd-86cd-4459-b7ab-e676637d5b6d","resolution":{"observed_at":"2026-07-04T07:39:39.555548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":"2401.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-04T07:59:39.550340Z","title":"Xue, L., Fu, Y ., Lu, Z., Mai, L., and Marina, M","venue":null,"work_id":"2fcfe188-dd65-40ca-b9f1-f10a58f699ae","year":2025},"citing_paper":{"arxiv_id":"2606.21868","last_updated":"2026-06-20T04:10:34Z","snapshot_observed_at":"2026-08-06T05:17:32.033245Z","submitted_at":"2026-06-20T04:10:34Z","title":"WiSP: A Working-Set View of Mixture-of-Experts Serving on Extremely Low-Resource Hardware","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T12:40:53.103233Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2606.21868"},"observation_digest":"sha256:83f7a43db6ac1bb27b4ec71d649ba7eaa5f19eae0ac77e2b5083168c5f9afc38","observation_id":"0586afed-f7b3-4eb8-9d54-1716a183b7d3","resolution":{"observed_at":"2026-07-04T07:49:39.570088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-14T13:40:50.742149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10183","last_updated":"2026-07-14T15:02:22Z","snapshot_observed_at":"2026-07-17T23:19:05.305876Z","submitted_at":"2026-07-11T08:00:05Z","title":"Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T13:40:50.742149Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2607.10183"},"observation_digest":"sha256:a146072b12096f200e0ee24b3d8d498082a717d4a225fb6f0392390a66dae48c","observation_id":"6863ad4a-8a91-4c67-b247-f838f9f292f3","resolution":{"observed_at":"2026-07-14T13:40:50.742149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-07-31T15:02:37.574777Z","title":"2401.14361 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24434","last_updated":"2026-07-27T13:44:42Z","snapshot_observed_at":"2026-08-04T22:26:57.428934Z","submitted_at":"2026-07-27T13:44:42Z","title":"DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T15:02:37.574777Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2607.24434"},"observation_digest":"sha256:999676721b0dd6f0d20af3e8cbc531abc94fd27126ce71de2599d0a936a1587b","observation_id":"43ad2203-067a-49c0-a69e-efe1f2f3fcfc","resolution":{"observed_at":"2026-07-31T15:02:37.574777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-05T00:37:29.052904Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00577","last_updated":"2026-08-01T10:30:01Z","snapshot_observed_at":"2026-08-09T05:23:12.352763Z","submitted_at":"2026-08-01T10:30:01Z","title":"HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:37:29.052904Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2608.00577"},"observation_digest":"sha256:cf0ea34d8ca11638ffdf114fe48ae10c749b73f3d890b8653f41f9b194f12ae3","observation_id":"7dbd1280-86be-4709-a542-8d32f1fd8085","resolution":{"observed_at":"2026-08-05T00:37:29.052904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-06T23:51:37.745029Z","title":"doi:10.48550/arXiv.2401.14361 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04454","last_updated":"2026-08-05T05:09:20Z","snapshot_observed_at":"2026-08-09T05:23:13.316163Z","submitted_at":"2026-08-05T05:09:20Z","title":"Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:51:37.745029Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2608.04454"},"observation_digest":"sha256:ffe6c8dfd4fb84b7ee13df21fce62389b8710d93f1cbffafb59c83196d985a53","observation_id":"b5f181eb-5125-4db1-8aeb-b2973b4e5ba1","resolution":{"observed_at":"2026-08-06T23:51:37.745029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.14361/citation-record","integrity":"/paper/2401.14361/integrity","json":"/paper/2401.14361/citation-record.json","paper":"/paper/2401.14361"},"outbound":[],"paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T05:22:39.483538Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2401.14361."}