{"as_of":"2026-08-08T19:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62d93b5f0b2c8a59854d78bf8d6f21655f1c4cebb63a3e28904ab3eda3b6d0b0","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:12:49.662460Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.03992/citation-record","integrity":"/paper/2601.03992/integrity","json":"/paper/2601.03992/citation-record.json","paper":"/paper/2601.03992"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:45.246249Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:45.246249Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:bed1bb01984cedd5783b4d7be2d5f4ed6b8c0ee6484c8ede841bc80c96b3ebd9","observation_id":"fb908f54-7c62-445c-904c-a84efd3f76aa","resolution":{"observed_at":"2026-08-03T12:12:45.246249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:45.330770Z","title":"Adaptive mixtures of local experts,","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:45.330770Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:410e3fcac03f2989b6c1d78ef44e80befac30d0c08ff8d0b6aab31a4125e1358","observation_id":"9c069319-6e8e-4f6b-b780-899828ee8ad3","resolution":{"observed_at":"2026-08-03T12:12:45.330770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:45.481094Z","title":"Outrageously large neural networks: The sparsely- gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:45.481094Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:9ff2828afe0a90317c4f6fecb20d5f580709325cc090312a51a440a524acd500","observation_id":"040eb670-725b-49f8-aeab-6dc394e1cbd8","resolution":{"observed_at":"2026-08-03T12:12:45.481094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T12:12:45.584804Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:45.584804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:7cf621f874bb1267d443de2e4f50ac5583ca3515d3551dfbd1b1403900c78ff3","observation_id":"c8ba9011-0790-4f7f-900c-a4856e6ce203","resolution":{"observed_at":"2026-08-03T12:12:45.584804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T12:12:45.682060Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:45.682060Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:366d2d31708e0df9cbd95c49d6bf35c60781a0dc65da1c84fc7664b8eaf7794f","observation_id":"798e843b-507d-46db-9c8a-5795a5da64a2","resolution":{"observed_at":"2026-08-03T12:12:45.682060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-03T12:12:45.857396Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:45.857396Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:1655312f55ae08ef246d6c70a04bc08fa0857765bf11b01f200293a3fb6377b6","observation_id":"b9f9bbad-12eb-4684-9c98-b3d3884a54c3","resolution":{"observed_at":"2026-08-03T12:12:45.857396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:46.032169Z","title":"Anda: Unlocking efficient llm inference with a variable- length grouped activation data format,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.032169Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:75e565d5f1a517476eb4183526b23dbdcfd23311eb9676cad6dc01b50e31a60c","observation_id":"77d96968-f5a7-424e-a377-1b2cd3680072","resolution":{"observed_at":"2026-08-03T12:12:46.032169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:46.199042Z","title":"A survey on mixture of experts in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.199042Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:7a5a608b4d33a05aeb143187663645262e0ae6c1fd64b424eaa458bc74f395ad","observation_id":"c2580717-12ba-485c-a366-3a679e19a3af","resolution":{"observed_at":"2026-08-03T12:12:46.199042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:46.372783Z","title":"(2025) GeForce RTX 5080","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.372783Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:7cf9be84465e97724c188bb7552f3635127ca61b19f941638281904db042974f","observation_id":"dd75ece3-f377-482d-9eb4-1c96fe40361f","resolution":{"observed_at":"2026-08-03T12:12:46.372783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T12:12:46.501611Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.501611Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:12b45c0b354e95dc861d836c2afe9ea7d568f9945baadbedb5977d0ecac8c501","observation_id":"6f3bd0c9-0b32-4f35-bf22-b8e86318e18c","resolution":{"observed_at":"2026-08-03T12:12:46.501611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:46.637460Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.637460Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:4c335d8c87704f5c5d02ae6265506eb24f708ed5781eed7e1e6b99175b61b499","observation_id":"4f595b27-c512-46d0-8bb1-d8aa7b4ae2b0","resolution":{"observed_at":"2026-08-03T12:12:46.637460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:46.731223Z","title":"Klotski: Efficient mixture-of-expert inference via expert- aware multi-batch pipeline,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.731223Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:d740626dad118f425f810164a7eb17271d1a84e8e65b14716eac90479a6f20f2","observation_id":"7d60b81f-dad6-4b85-90da-0421a5b5a144","resolution":{"observed_at":"2026-08-03T12:12:46.731223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-07-06T17:09:24.271573Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-03T12:12:46.908768Z","title":"Fast inference of mixture-of-experts language models with offloading,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:46.908768Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:aa9f09eda55a19529418e1037e556d86a55ca3584bc860cae98c6885469bb0b2","observation_id":"55c79c1e-5af5-4994-ab70-2257e512a681","resolution":{"observed_at":"2026-08-03T12:12:46.908768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.073480Z","title":"DAOP: Data-aware offloading and predictive pre- calculation for efficient moe inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.073480Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:92e04aa114a9479b479ac2381aa7c449f7324f3b458da9722d6aea4b3dbe512e","observation_id":"b6305259-e3db-461a-8787-04ef004c4b67","resolution":{"observed_at":"2026-08-03T12:12:47.073480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.134788Z","title":"Moe-lightning: High-throughput moe inference on memory-constrained gpus,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.134788Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:e3367026befefcce81fbe4f5c406e8889f39c15bacfc2100eeb3406fd36301c6","observation_id":"c78c45cc-9a64-4796-bc27-61a70a4db24a","resolution":{"observed_at":"2026-08-03T12:12:47.134788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.176571Z","title":"Fiddler: CPU-GPU orchestration for fast inference of mixture-of-experts models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.176571Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:b031b2cdea7e8e3afb3d2b161015ef29aa9639290b947d312c7fbb798bfb62fd","observation_id":"dfb7a272-16ae-4c75-8266-941ea208f832","resolution":{"observed_at":"2026-08-03T12:12:47.176571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.263000Z","title":"Monde: Mixture of near-data experts for large-scale sparse models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.263000Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:4380797a12d8c26b32bb91aeaacfe81125d2c1ee484449ef1c476c523754603f","observation_id":"d018a23c-8b61-4c64-8ffa-a5e838a69b61","resolution":{"observed_at":"2026-08-03T12:12:47.263000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.351344Z","title":"Duplex: A device for large language models with mixture of experts, grouped query attention, and continuous batching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.351344Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:74a86e9ae6e7ae2624b631fd97495a751f0a7ca64650ccf083d917bac3a0ce98","observation_id":"5095e32c-e81e-4822-bcdc-f2f23f1d6f58","resolution":{"observed_at":"2026-08-03T12:12:47.351344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.419157Z","title":"Co-designing binarized transformer and hardware accel- erator for efficient end-to-end edge deployment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.419157Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:74df7585ae621859412624a13de0932e85c9e2ed9b75ae12b1eccf93e9a6d4e4","observation_id":"b453858d-4086-434b-a15a-744210aede6d","resolution":{"observed_at":"2026-08-03T12:12:47.419157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.512321Z","title":"Language models at the edge: A survey on techniques, challenges, and applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.512321Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:3347880912b331567f8363323ae3cee739c056002ddb186065f7a08d9d72bed7","observation_id":"9156e491-9016-40bb-9e00-5ef4c67a2c51","resolution":{"observed_at":"2026-08-03T12:12:47.512321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.604670Z","title":"A precision-scalable risc-v dnn processor with on-device learning capability at the extreme edge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.604670Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:ebf82f5cb666edb34ad589187a60bb795c8ef17b2e63d9f6825f170cc2371358","observation_id":"1fdc3f5b-7058-474d-8dd4-8571e2cec33d","resolution":{"observed_at":"2026-08-03T12:12:47.604670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.700109Z","title":"Spark: Scalable and precision-aware acceleration of neural networks via efficient encoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.700109Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:db4546717b326fd6c53677b29df84f45ace2c54bfdf950d104b9d89db7fb52ef","observation_id":"f9aab894-9168-4329-a9c2-3d5d1ab96678","resolution":{"observed_at":"2026-08-03T12:12:47.700109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.790247Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.790247Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:619cab4305edcdf4a451f606a6ccf7653086b4f46c57ba5103bcf633edd9d0b6","observation_id":"72c14f80-ecbd-435b-aa5f-51eebba247bd","resolution":{"observed_at":"2026-08-03T12:12:47.790247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:47.878841Z","title":"Recnmp: Accelerating personalized recommendation with near-memory processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:47.878841Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:d7673e5a7df6f7ad541ae7fc516aa8ccec7f867baa8dbf68da6242104e3f161d","observation_id":"2cc085ba-503a-4bcf-bbbe-134d1b3aef5e","resolution":{"observed_at":"2026-08-03T12:12:47.878841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.035954Z","title":"Tensordimm: A practical near-memory processing architecture for embeddings and tensor operations in deep learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.035954Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:d92215e15915e800f62eff1f55bcd8544daedea997b5b06bc1a78a3b7dbb1311","observation_id":"6b0bf0c4-6d8e-4874-af4e-e49eca8e287a","resolution":{"observed_at":"2026-08-03T12:12:48.035954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.119842Z","title":"Attacc! unleashing the power of pim for batched transformer-based generative model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.119842Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:f01ee1646655d482a4fa8213209806991991c40d0a3ea4719b9bdbf8de5152e6","observation_id":"23489549-cbba-4acd-bd44-1773d0a8c3ab","resolution":{"observed_at":"2026-08-03T12:12:48.119842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.223436Z","title":"PIMoE: Towards efficient moe transformer deployment on npu-pim system through throttle-aware task offloading,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.223436Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:635c3b94c82e86137ef0d04627d9938d0a05f83e7de394275933b692188b2788","observation_id":"8baebdbd-3461-4ad5-af9d-2e813169c9ca","resolution":{"observed_at":"2026-08-03T12:12:48.223436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.299533Z","title":"Make llm inference affordable to everyone: Augmenting gpu memory with ndp-dimm,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.299533Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:835395fbe42d1de812d1e0a964ee625b0b20a3d34b8fbbfc3cf1190b81cb16dc","observation_id":"87a6ccdb-83b2-44d8-8705-3b301705dfe3","resolution":{"observed_at":"2026-08-03T12:12:48.299533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.429188Z","title":"The true processing in memory accelerator,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.429188Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:f878523e6c5ba307de99658ad718bf0133f0d48471b19d0871413842f91ac68f","observation_id":"d36e300a-70f9-4da5-b29a-b73369e0cc3b","resolution":{"observed_at":"2026-08-03T12:12:48.429188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.502980Z","title":"LP-Spec: Leveraging lpddr pim for efficient llm mobile speculative inference with architecture-dataflow co-optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.502980Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:0aec1c502dfd2e8c44605f422c181843543395f283d5b21e6eb9788dde793d8a","observation_id":"4b8310dd-19bb-4e6b-ae5c-e2295098443e","resolution":{"observed_at":"2026-08-03T12:12:48.502980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.608565Z","title":"Ndpage: Efficient address translation for near-data pro- cessing architectures via tailored page table,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.608565Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:6e18ff6642e45dc26b1b1b0390acdf4d2cbde4834b0fc936f01939520dddb37c","observation_id":"79d59443-36f5-41f6-9dac-53b5672c11c8","resolution":{"observed_at":"2026-08-03T12:12:48.608565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.740231Z","title":"Hyqa: Hybrid near-data processing platform for embed- ding based question answering system,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.740231Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:ed27c06951d3995afd4f8656bef26a5ab694b930e9267a7b80301d3e315789a0","observation_id":"43dcc1e0-9a50-4d7d-9a2b-346fdf6e1b1f","resolution":{"observed_at":"2026-08-03T12:12:48.740231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.840345Z","title":"Near-memory parallel indexing and coalescing: Enabling highly efficient indirect access for spmv,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.840345Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:1a9fab60ad4c8587b05e58b3f1e0a3ed68033b5593cbfe1cbe3d675715a3b1f6","observation_id":"2d22f975-30f8-4062-8ad2-fe8b650b36ae","resolution":{"observed_at":"2026-08-03T12:12:48.840345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:48.904066Z","title":"Um-pim: Dram-based pim with uniform & shared memory space,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:48.904066Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:7bfedc1e86a0ec7bce750a65fc1effcc0f02aef061dd19961d514afab9ef529f","observation_id":"8cc330cc-7484-4e7e-bbb6-1184a963bc1a","resolution":{"observed_at":"2026-08-03T12:12:48.904066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:49.006935Z","title":"Bramac: Compute-in-bram architectures for multiply- accumulate on fpgas,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.006935Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:dc65b7803277ac8daea06caef4e48356806dd0c4a4147adcec1790dcb660d8df","observation_id":"9877c3c1-1c39-4302-b36c-c18530c54ea0","resolution":{"observed_at":"2026-08-03T12:12:49.006935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:49.108408Z","title":"An overview of processing-in-memory circuits for artificial intelligence and machine learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.108408Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:567573369b1557a0d792265816e42ccc2b93550b5b6d8b1b4cd2fd76eea89860","observation_id":"320f2894-342f-4de9-af40-4b84f23cdf2e","resolution":{"observed_at":"2026-08-03T12:12:49.108408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-03T12:12:49.179344Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.179344Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:7759a15975032a2716ecb706e786d4d5b2b89edbba5076c9b43f933c8c348468","observation_id":"68b97508-1b2b-421f-b195-90957737fd48","resolution":{"observed_at":"2026-08-03T12:12:49.179344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:49.293176Z","title":"Aim: accelerating computational genomics through scalable and noninvasive accelerator-interposed memory,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.293176Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:e311f98fa775186050dda9c2e10e0950dd77dd2bf81eededb6955b457f6361bd","observation_id":"d58f14cc-db82-4710-a1c3-ea80e7dcac6d","resolution":{"observed_at":"2026-08-03T12:12:49.293176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:49.350877Z","title":"(2025) intel-core-i7-14700","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.350877Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:145640188797d34cf6418c7deef0ea61a3f4edd3379c1bf224ab064bd03d2996","observation_id":"bc86f0e8-9fb7-4aff-9fbc-1eb2e95a0d7e","resolution":{"observed_at":"2026-08-03T12:12:49.350877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:49.452877Z","title":"Ramulator 2.0: A modern, modular, and extensible dram simulator,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.452877Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:48cad18de1280153aa06f4085304d07fce3723fb672283476a771db9a3122ea2","observation_id":"5ce93888-8b09-4c08-beed-03005f3e05ea","resolution":{"observed_at":"2026-08-03T12:12:49.452877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:12:49.560097Z","title":"DeepSeekMoE: Towards ultimate expert specialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.560097Z"},"links":{"citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:4c1df172c1c997d199df57ef97fe7745581865b1ee6d4a0082eb6cc04368a0bc","observation_id":"3da4ecce-5822-4ad8-9ef6-7ccbcdd31636","resolution":{"observed_at":"2026-08-03T12:12:49.560097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13833","last_updated":"2024-08-23T00:04:31Z","snapshot_observed_at":"2026-08-04T15:15:15.423637Z","submitted_at":"2024-07-18T18:06:59Z","title":"Phi-3 Safety Post-Training: Aligning Language Models with a \"Break-Fix\" Cycle","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13833","snapshot_observed_at":"2026-08-03T12:12:49.662460Z","title":"Phi-3 safety post-training: Aligning language models with a ‘break-fix’ cycle,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T12:12:49.662460Z"},"links":{"cited_paper":"/paper/2407.13833","citing_paper":"/paper/2601.03992"},"observation_digest":"sha256:739ef4026e7dfc81820871e44bd6d891a01bf442b6fc6a459fb29118a16f3a0e","observation_id":"07c7e0cb-b925-4b9e-8dd4-6bfa3fa1c13d","resolution":{"observed_at":"2026-08-03T12:12:49.662460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.03992","last_updated":"2026-01-07T15:02:57Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-05T20:26:32.251065Z","submitted_at":"2026-01-07T15:02:57Z","title":"A Scheduling Framework for Efficient MoE Inference on Edge GPU-NDP Systems"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2601.03992."}