{"as_of":"2026-08-22T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55c462932115bacf70db6223adf53ec285927b2dd1e50393b53f139e22cf9186","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:00:18.175589Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T10:32:50.809236Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:36:25.890370Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"cited_work":{"arxiv_id":"2505.05950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.05950","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0a1d736a-ecc2-4036-877f-112890ba2864","year":2025},"citing_paper":{"arxiv_id":"2604.26881","last_updated":"2026-04-29T16:47:48Z","snapshot_observed_at":"2026-08-15T01:14:52.485209Z","submitted_at":"2026-04-29T16:47:48Z","title":"FaaSMoE: A Serverless Framework for Multi-Tenant Mixture-of-Experts Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T10:32:50.809236Z"},"links":{"cited_paper":"/paper/2505.05950","citing_paper":"/paper/2604.26881"},"observation_digest":"sha256:5a12f31beb28695499a859aec7f5c579c23b54c1fe8f3d20b6e5ef1cf4e47306","observation_id":"513369c9-9c91-4e0b-ad07-1138bdc3b9cd","resolution":{"observed_at":"2026-05-12T09:36:25.893028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.05950/citation-record","integrity":"/paper/2505.05950/integrity","json":"/paper/2505.05950/citation-record.json","paper":"/paper/2505.05950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T23:00:17.731611Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.731611Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ffa27e5ef7054000996f4873093ef772738238ff18bd0043d0b2964469129133","observation_id":"677af2a7-ab45-4cc1-a6cf-26fd2a0eb536","resolution":{"observed_at":"2026-08-15T23:00:17.731611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-20T14:44:18.211453Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-15T23:00:17.739273Z","title":"J., Javaheripi, M., Kauffmann, P., Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.739273Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:acb733bbe95a2240aabe67534bfd56006d934c24b4f404b75aaee351931a1f62","observation_id":"bab1eeb2-937e-47af-a381-8421766f1a6b","resolution":{"observed_at":"2026-08-15T23:00:17.739273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11514","last_updated":"2024-07-30T23:37:20Z","snapshot_observed_at":"2026-08-19T12:40:37.732356Z","submitted_at":"2023-12-12T18:57:08Z","title":"LLM in a flash: Efficient Large Language Model Inference with Limited Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11514","snapshot_observed_at":"2026-08-15T23:00:17.745925Z","title":"C., Rastegari, M., and Farajtabar, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.745925Z"},"links":{"cited_paper":"/paper/2312.11514","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:15c9dd30b47083b5d5af69524fa36c2722a89c26c5ee268bff2cb94ef42a97cb","observation_id":"3a684dc7-b459-4971-9310-dbc1ee9f3a79","resolution":{"observed_at":"2026-08-15T23:00:17.745925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.751415Z","title":"Y., Rajbhandari, S., Awan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.751415Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:54f52461f7437d8900fa49cfc8470907587bfed90db090c3c169a81924c55eb2","observation_id":"e76686a2-ee19-4dfa-b3fa-d00fbaa16392","resolution":{"observed_at":"2026-08-15T23:00:17.751415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.216430Z","title":"and Shaji, A","venue":null,"work_id":"a6d8e382-b463-49c2-b2e2-2ce1bf6a544f","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.757214Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:3594d91d8385ba39ccd4c7ab2713ff08ba1c53d92a38f992ad83c0cf674a860f","observation_id":"d76b3fe7-ac24-4bae-bad1-10d4219a1f68","resolution":{"observed_at":"2026-08-15T23:00:20.224588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-18T20:24:28.154075Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"cited_work":{"arxiv_id":"2411.11217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.11217","snapshot_observed_at":"2026-08-15T23:00:19.435484Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","venue":"cs.DC","work_id":"7d33d0fc-8af2-4c03-bc04-8049f1594a2c","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.763102Z"},"links":{"cited_paper":"/paper/2411.11217","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7fec6a41394372e68431b027ea8b82d9289353627f756ebd5deb0780758bb1f1","observation_id":"3ce825a4-85b8-4bf8-b9a9-d13331b3daf9","resolution":{"observed_at":"2026-08-15T23:00:19.443779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.191098Z","title":"Active multi-task representation learning","venue":null,"work_id":"56fc214a-e8c4-4302-bbe9-233e41e3160a","year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.769821Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:1600243e4ec5f379a47700848db961c1e81dec60fae798225e34ee242d1c6d13","observation_id":"c5e29aa8-6157-4dfb-9fbe-580f2760c38a","resolution":{"observed_at":"2026-08-15T23:00:20.199982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-17T14:44:42.060038Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-15T23:00:17.775307Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.775307Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:881101ef32ddf3ff72c295513d57b93d8340eb248642a864a933445dc0359ae5","observation_id":"bfe644cd-5cd9-4aa9-abd9-01ff6d4eabea","resolution":{"observed_at":"2026-08-15T23:00:17.775307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T23:00:17.782233Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.782233Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:02294e4088bee5c4ed99a994bd0fae517724293ccc1711bec41aff2e9adea7c1","observation_id":"52f07ce0-f174-4036-9d54-5bba9f6fc698","resolution":{"observed_at":"2026-08-15T23:00:17.782233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.791097Z","title":"D eep S eek M o E : Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.791097Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9f4e0bb2d410256fe4f48502a0c24990484ae82fb2d14ddac34946a05dfbf101","observation_id":"327c293c-9f4a-49ae-95b0-424966f745af","resolution":{"observed_at":"2026-08-15T23:00:17.791097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.799618Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.799618Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:91e553566e4dc0a6da866c682e53ef0acf95a3e0bd3a3f3bf8a19c01c385ba0a","observation_id":"727dac6a-b239-4e5c-b196-f08320653ecf","resolution":{"observed_at":"2026-08-15T23:00:17.799618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T23:00:17.806520Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.806520Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:88f6a2c85d785d40c40bd97d7f550f5aa2108f9ec5f27e20612727305af4a7bd","observation_id":"47029fd0-e2e1-477d-88f6-0b58449e6d6d","resolution":{"observed_at":"2026-08-15T23:00:17.806520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09434","last_updated":"2021-03-30T04:06:04Z","snapshot_observed_at":"2026-08-20T22:33:41.299002Z","submitted_at":"2020-02-21T17:30:00Z","title":"Few-Shot Learning via Learning the Representation, Provably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09434","snapshot_observed_at":"2026-08-15T23:00:17.816788Z","title":"S., Hu, W., Kakade, S","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.816788Z"},"links":{"cited_paper":"/paper/2002.09434","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:4aa74e432e8598a55e4fc27d7b0a217fd90c85d12c412a3676751de1749c20c0","observation_id":"7a525660-27d3-4001-9f46-2fccff125050","resolution":{"observed_at":"2026-08-15T23:00:17.816788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T23:00:17.823318Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.823318Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:d23180df4246ca49f79aae3f833086dc4d1a29f03ddb88d93a9dabe25d44ab59","observation_id":"cbdf6ffa-d052-4180-8de0-69afaa65e337","resolution":{"observed_at":"2026-08-15T23:00:17.823318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.140864Z","title":"mixtral-offloading","venue":null,"work_id":"67ac9d6a-83cc-49a1-9a50-0e03632eeae7","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.828971Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:3d1b5ee7a546c2983197d38adfdab1913c3810c5317cd6baebeab8fb5e51e723","observation_id":"725c3151-30e9-4283-8e9a-ce509f742b17","resolution":{"observed_at":"2026-08-15T23:00:20.148601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-19T12:48:02.319950Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-15T23:00:17.834440Z","title":"and Mazur, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.834440Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:cfc1d20caaabfef4a1639548473ff2b96e900c86fd557fe7f9e14e27fbed866a","observation_id":"24a75ecc-bda2-479a-a402-2e51d3870d32","resolution":{"observed_at":"2026-08-15T23:00:17.834440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.840069Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.840069Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:8476a289ca02542f50c8621c631d15c2ba7e4b3504be38235fdd9a14df498f31","observation_id":"84ee202f-5eb4-4359-804f-d3be1ea19b8d","resolution":{"observed_at":"2026-08-15T23:00:17.840069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.097555Z","title":"and Alistarh, D","venue":null,"work_id":"ad998f8c-dd94-459f-8d61-a3eec4831ba2","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.846718Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:cdf72bb55a58b85a49f0ed9dbba3c37074389afb43cdb04e2798bf9f9debf3c0","observation_id":"c143d9d5-eff0-4231-8ad8-99bb8ed62d2c","resolution":{"observed_at":"2026-08-15T23:00:20.108972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.852078Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.852078Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:c0616b6b75a87d8a3f58d1765fa95087568ca95cf7a594e955c6af4a6e11a2b6","observation_id":"bab7de65-c6fd-478b-9bbd-083636a3e1e6","resolution":{"observed_at":"2026-08-15T23:00:17.852078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.857019Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.857019Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:5e906a836b4ac5a6cbfc8f2c9669be3735fa54d53fdeca755ce764e17faa32fd","observation_id":"90db61db-82a7-4a3e-83e0-43e8603c7159","resolution":{"observed_at":"2026-08-15T23:00:17.857019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.863141Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.863141Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9ada038c80e75d13a996eb210c5f55b79d718904190a80df0ac71fbcc4fdfc34","observation_id":"28e977d2-584b-4820-88f5-c5ecb758d738","resolution":{"observed_at":"2026-08-15T23:00:17.863141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.035078Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":"7a51bcb3-1d8a-4bb3-b3b6-68bb1fbe2290","year":2022},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.869011Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:1149443ea012460c8dbd78868a253d78ade07fbb72114468ed213bc8e1ad0b78","observation_id":"bb5fd3d0-45d8-4e20-b9d1-6287cebae18b","resolution":{"observed_at":"2026-08-15T23:00:20.041897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01366","last_updated":"2024-12-27T17:49:34Z","snapshot_observed_at":"2026-08-16T21:41:41.786414Z","submitted_at":"2024-09-02T16:41:44Z","title":"CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification","version":2},"cited_work":{"arxiv_id":"2409.01366","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01366","snapshot_observed_at":"2026-08-15T23:00:19.144757Z","title":"CHESS: Optimizing LLM Inference via Channel-Wise Thresholding and Selective Sparsification","venue":"cs.CL","work_id":"d979e774-86ef-4044-a762-f8e469d2094e","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.875990Z"},"links":{"cited_paper":"/paper/2409.01366","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:bc7d3ee1d469bd9d9e33fd6d482181092e41072074ece6a21bdba2892fee38da","observation_id":"41ee817b-2f93-4290-b901-4f84ed2fac7c","resolution":{"observed_at":"2026-08-15T23:00:19.156537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T23:00:17.881727Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.881727Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:343bd13196cbad5a99a0a90b93fb3773c0bbb1f5ff9c9c9bc12ac6eadbd08e5b","observation_id":"3b58a5f5-e855-4a40-b0c3-80347f028c66","resolution":{"observed_at":"2026-08-15T23:00:17.881727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:20.012402Z","title":"Pre-gated moe: An algorithm-system co-design for fast and scalable mixture-of-expert inference","venue":null,"work_id":"2b037a25-a68c-402f-88d4-7114ee0a7957","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.887270Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:43ea97769636e052e733bee336a89905b4079f12acb80f3f389218b98226b140","observation_id":"0480f9b6-fb16-4211-b02d-6eb2c6daaf25","resolution":{"observed_at":"2026-08-15T23:00:20.020055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T23:00:17.896175Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.896175Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:1a7c47cae97ff739b6c2bf0ca507a3e3519aef56fdfdcb894d5a9e2c4ee2f216","observation_id":"86d25de5-e46b-41be-8515-7729a727dab2","resolution":{"observed_at":"2026-08-15T23:00:17.896175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.902621Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.902621Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:14d98374c6c05b4a15ae94b432fe5329448a47aebc0c99279355af71f9f05b80","observation_id":"c6483c91-a401-4d11-a347-f66fe7148c14","resolution":{"observed_at":"2026-08-15T23:00:17.902621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-19T12:47:59.699310Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-15T23:00:17.909669Z","title":"Fiddler: Cpu-gpu orchestration for fast inference of mixture-of-experts models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.909669Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7f8bbcab683243cef5570528655c7f4ecb09dd362f41a5efdd99817bf6ad2a30","observation_id":"1ede6a3e-f848-411e-952d-fd84810af759","resolution":{"observed_at":"2026-08-15T23:00:17.909669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.954408Z","title":"S wap M o E : Serving off-the-shelf M o E -based large language models with tunable memory budget","venue":null,"work_id":"a2cabd8a-059e-437b-8723-13acd34336d3","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.918029Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:5d26c9459c2696a4f1b7c9f57d662460d2ec194309da2116e11945290ef0dce2","observation_id":"b9869fc6-dd19-4af2-89c0-e12f69f572a6","resolution":{"observed_at":"2026-08-15T23:00:19.964733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.926214Z","title":"CATS : Context-aware thresholding for sparsity in large language models","venue":null,"work_id":"de30c521-edb8-4286-9426-ece73981dae1","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.923383Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9f11aa45e1cdc75603b7a1a3241b5e16398ded0825c96f053f6894218feef8a0","observation_id":"2f39fe42-3c72-43c4-b54d-70ead58ce9c4","resolution":{"observed_at":"2026-08-15T23:00:19.937766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.903837Z","title":"InfiniGen : Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":"0f16f4b4-ea34-4bf1-8257-ce283dec6cc5","year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.930729Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:53987e453b8cb386f62e9fca4f8efd974aa68fcdd01346361f9ea82ceda3d643","observation_id":"ccd9857e-4fa1-42d1-835d-18a12ca7d368","resolution":{"observed_at":"2026-08-15T23:00:19.910507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14690","last_updated":"2025-02-25T21:00:50Z","snapshot_observed_at":"2026-08-18T15:24:37.105582Z","submitted_at":"2024-08-26T23:30:15Z","title":"Training-Free Activation Sparsity in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14690","snapshot_observed_at":"2026-08-15T23:00:17.937817Z","title":"Training-free activation sparsity in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.937817Z"},"links":{"cited_paper":"/paper/2408.14690","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:bbb77a9b64a884ca4af418845c7ba0c2db1511fe227193f746de4aea979ca0d0","observation_id":"721b679f-5e19-4d5b-8847-d32c9d840572","resolution":{"observed_at":"2026-08-15T23:00:17.937817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.873604Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":"c8bbfdac-a30e-43e4-a1a4-cc99ca2aa2d3","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.944379Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:3f828620ee6f882e4fdc8cc1547910efb0060510f71a65c27aabb02705158d3e","observation_id":"90acd159-9eae-44a2-be46-2df4ef83b4a5","resolution":{"observed_at":"2026-08-15T23:00:19.883330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.845566Z","title":"llama.cpp","venue":null,"work_id":"9ebeee57-45d0-4814-bf35-8bab19c37c2f","year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.952242Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9bf543a1ead5929a47a5d86e0e566d2e4d12a56a7516bf3412f01e61a635aa99","observation_id":"12c6a7b1-854a-4a6f-9f98-cd25bd05f0a2","resolution":{"observed_at":"2026-08-15T23:00:19.857973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.821081Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":"0ae6ee03-1f6c-4fbe-b8e7-c2bea966c79d","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.960800Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:80ad2fb2dac10f40b740c4a4ae924164ebc91ab676ccf4be088383ba7baa5cc6","observation_id":"2e1be1af-7e6a-4334-80b9-d51fcc0d4362","resolution":{"observed_at":"2026-08-15T23:00:19.829297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:17.966839Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.966839Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:8db5aa8ac3d7ba8d368a3bfa83683b1bf572d2f0a96d99ac4732dcf526147c94","observation_id":"fa720d6d-75bb-44eb-b3f7-6cdfe7b87cfb","resolution":{"observed_at":"2026-08-15T23:00:17.966839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.781100Z","title":"Deepspeed-mii","venue":null,"work_id":"3e4171b3-51dc-4a7f-9700-1acce6bfa96a","year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.973800Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9c2c4fb5ee54531ef21f0966b76e137acb92ea1b2887283267ddb2c09690fd21","observation_id":"8298ebcf-7fd1-4210-a33b-d5de6894be62","resolution":{"observed_at":"2026-08-15T23:00:19.787328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-21T08:23:35.014784Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-15T23:00:17.983480Z","title":"C., Tuzel, O., Samei, G., Rastegari, M., and Farajtabar, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.983480Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9506c7a7b9f78daa23ee58ea27fa943cfe4083259eb78bc291af474e53d05a8e","observation_id":"4996bea5-75f8-4329-9f3b-c6a878ea5b9c","resolution":{"observed_at":"2026-08-15T23:00:17.983480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T23:00:17.989790Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.989790Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ef481ef94d9df867ea0eab758d85b87af3b40068d93e06de28bfbddc81e68500","observation_id":"cdc1ba83-bfda-4c95-86b3-d3ca038e1f71","resolution":{"observed_at":"2026-08-15T23:00:17.989790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.752394Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"da51540a-a1f2-4fb7-bba2-e8418d673f10","year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:17.995847Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:79069e3e6f192d18713e906d03d164562e1b1b11338da1aa65b52ff552e5b5a8","observation_id":"d91d0e5e-58af-4a06-8580-15f3e665cb1e","resolution":{"observed_at":"2026-08-15T23:00:19.759512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.005803Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.005803Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:43cd15801d3ff70c0ab55055e10527ef0b4698df31396ba5b1377b2c825453f9","observation_id":"02c19407-6e5e-4461-b6bc-a9ab78ee0377","resolution":{"observed_at":"2026-08-15T23:00:18.005803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.015066Z","title":"Zero-infinity: breaking the gpu memory wall for extreme scale deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.015066Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:b045b78ef879cb36128854a5a00821368e5d10659c9d2600c5a854e2d18960c0","observation_id":"9a578f77-24fc-484b-916a-488691c6535a","resolution":{"observed_at":"2026-08-15T23:00:18.015066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-15T23:00:18.021867Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.021867Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:903fb6eb1e02a91ca1a612f017aedae668340dd20f52d157eafc8809eff56812","observation_id":"247c01b2-1b5e-4d2e-a3be-0c67cf207d01","resolution":{"observed_at":"2026-08-15T23:00:18.021867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.710407Z","title":"Edge-moe: Memory-efficient multi-task vision transformer architecture with task-level sparsity via mixture-of-experts","venue":null,"work_id":"09139836-2224-47ac-9721-b31e445ea627","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.027790Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:5b49ffc17665319e5bc49cf49da5bad242559068b4f1ac13699b65cfe2787c95","observation_id":"379bb1b7-2012-488b-85e8-dd56140309c9","resolution":{"observed_at":"2026-08-15T23:00:19.716571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.684897Z","title":"Sharegpt","venue":null,"work_id":"98f1416a-9827-4a03-ac36-70f089400937","year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.033475Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9c832bca22917918fefd23afc56aab5b0fbb4c20b07741580b2a352370ec9d55","observation_id":"743ac543-05d0-4955-94e1-eb0d5c5b87b2","resolution":{"observed_at":"2026-08-15T23:00:19.694207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-15T23:00:18.040770Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.040770Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:250b3eae509ac743a2ff9e1502c6c897b548e7c1b165f3fa15052d005f3e6050","observation_id":"3229b3bf-af95-4555-b7c4-e6dd604ab33e","resolution":{"observed_at":"2026-08-15T23:00:18.040770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.661938Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":"57b54ace-18ec-44ea-ac37-40a5271a774b","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.046116Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:dfdbde33db6092f317f784901b5f1506f1e54e2a5153d9e473dce7a0d1b7f5b0","observation_id":"6c7eeb3d-bca8-4529-b9cc-75833d975c4d","resolution":{"observed_at":"2026-08-15T23:00:19.670024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12692","last_updated":"2025-01-24T05:12:22Z","snapshot_observed_at":"2026-08-21T08:24:00.659107Z","submitted_at":"2024-11-19T17:59:12Z","title":"SparseInfer: Training-free Prediction of Activation Sparsity for Fast LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12692","snapshot_observed_at":"2026-08-15T23:00:18.053935Z","title":"Sparseinfer: Training-free prediction of activation sparsity for fast llm inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.053935Z"},"links":{"cited_paper":"/paper/2411.12692","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7207f2a4d979efa0b293d1cfc69000a856990995cbc586ca3ee0c23be779307a","observation_id":"79b653c8-7925-4814-85c9-3af318e79a75","resolution":{"observed_at":"2026-08-15T23:00:18.053935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13516","last_updated":"2025-01-07T05:26:54Z","snapshot_observed_at":"2026-08-16T14:16:44.568003Z","submitted_at":"2024-02-21T03:58:49Z","title":"ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13516","snapshot_observed_at":"2026-08-15T23:00:18.060634Z","title":"Prosparse: Introducing and enhancing intrinsic activation sparsity within large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.060634Z"},"links":{"cited_paper":"/paper/2402.13516","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:04d195c2adb28e5f0b27e36748af0c36d22a5ad6d2733a0ee7792fec1459386d","observation_id":"020fa894-8bee-4aa0-81da-03f28f859508","resolution":{"observed_at":"2026-08-15T23:00:18.060634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22134","last_updated":"2025-09-01T03:51:09Z","snapshot_observed_at":"2026-08-21T11:22:51.484077Z","submitted_at":"2024-10-29T15:31:27Z","title":"ProMoE: Fast MoE-based LLM Serving using Proactive Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22134","snapshot_observed_at":"2026-08-15T23:00:18.068102Z","title":"Promoe: Fast moe-based llm serving using proactive caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.068102Z"},"links":{"cited_paper":"/paper/2410.22134","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:9e05084f329a1925798c88a88f1657064bee510ba02cbf8c88d398856568a4a4","observation_id":"c8f6bcbe-b074-4bbf-b084-00f63654d330","resolution":{"observed_at":"2026-08-15T23:00:18.068102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-08-18T15:22:06.823821Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-15T23:00:18.080046Z","title":"Turbo sparse: Achieving llm sota performance with minimal activated parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.080046Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:6a605d93cf38c1a3e39ae3736d267d47fb264566497ad52d0261a9cb8c2e361d","observation_id":"84f9b36d-d5ba-4aa4-8804-3ff60ef17578","resolution":{"observed_at":"2026-08-15T23:00:18.080046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-20T04:15:03.506960Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-15T23:00:18.088388Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.088388Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:ba6ec1d38a79efd8f6dd22bfcc9542137d3b52bbf54e0276ffffe9b796552f11","observation_id":"fc400941-896c-477b-a247-7d5c13026a17","resolution":{"observed_at":"2026-08-15T23:00:18.088388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01433","last_updated":"2024-11-06T01:49:45Z","snapshot_observed_at":"2026-08-16T13:03:29.317209Z","submitted_at":"2024-11-03T04:25:46Z","title":"HOBBIT: A Mixed Precision Expert Offloading System for Fast MoE Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01433","snapshot_observed_at":"2026-08-15T23:00:18.099183Z","title":"Hobbit: A mixed precision expert offloading system for fast moe inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.099183Z"},"links":{"cited_paper":"/paper/2411.01433","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:82d5be63c88e30074a5f1a7d4524e337891b986767f4f373f00e4499e2ea68bb","observation_id":"020ce44c-6145-4969-b276-bd807a80f7a2","resolution":{"observed_at":"2026-08-15T23:00:18.099183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.105373Z","title":"Qwen1.5-moe: Matching 7b model performance with 1/3 activated parameters\", February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.105373Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:a337fbf593b31c62e6041fe1a8071153ab41d019eb5e1503bd626e5e47eba493","observation_id":"c5e2268d-4170-42b0-8a56-6860916b885c","resolution":{"observed_at":"2026-08-15T23:00:18.105373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08306","last_updated":"2021-05-18T06:46:48Z","snapshot_observed_at":"2026-08-20T01:15:18.400467Z","submitted_at":"2021-05-18T06:46:48Z","title":"Sample Efficient Linear Meta-Learning by Alternating Minimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08306","snapshot_observed_at":"2026-08-15T23:00:18.110331Z","title":"K., Jain, P., Netrapalli, P., and Oh, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.110331Z"},"links":{"cited_paper":"/paper/2105.08306","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:db65f2d1ce60a98da2b62ac5ad1de3778a564efb3a073e4f6d51f514c3906a63","observation_id":"34b0b7a3-6ade-4a8f-bae6-82b815c30366","resolution":{"observed_at":"2026-08-15T23:00:18.110331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.117468Z","title":"T., and Cox, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.117468Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:68b2e12d1f1a15d8b8d950d95bad6c8f8c6bd06ad9192ba26081775059525d3d","observation_id":"9e445290-c782-4165-9ed4-658d4a891137","resolution":{"observed_at":"2026-08-15T23:00:18.117468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.617630Z","title":"On the theory of transfer learning: The importance of task diversity","venue":null,"work_id":"39a2540c-810b-4356-9660-ccab5940faa5","year":2020},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.125925Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:7c9fa7111ee0adab6fdea6edeff4d799b9b3ad7ea407b588b1e95a6c52278ce3","observation_id":"e16e6808-ffae-4924-abbe-99bd90483fdc","resolution":{"observed_at":"2026-08-15T23:00:19.626650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.593980Z","title":"Provable meta-learning of linear representations","venue":null,"work_id":"4fc0c14e-765b-4fc3-badd-fd32133617d6","year":2021},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.133442Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:a1327eed327bb6ee9dbb61d4b83b8ebf20239190319e5af0c3d5185688889db8","observation_id":"ab80d049-fdd9-4250-8266-c4ec26090e30","resolution":{"observed_at":"2026-08-15T23:00:19.600418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:19.569721Z","title":null,"venue":null,"work_id":"6f2b24c0-be39-4773-9d16-1008e25220d4","year":2023},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.140080Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:1358865909557f51b135f2e2109e49cacbfc82895f704624e8e170d897f6dd50","observation_id":"2300d282-1841-401c-aa6a-b3c072c8df32","resolution":{"observed_at":"2026-08-15T23:00:19.577922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-20T12:24:17.997422Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-15T23:00:18.147537Z","title":"Moe-infinity: Activation-aware expert offloading for efficient moe serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.147537Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:750f0652030c247b2665eec419d6a5ab069f55c56e197f858afe1b9ee004fcc8","observation_id":"adff6728-d4ce-4fc3-aca1-7179da0c7abd","resolution":{"observed_at":"2026-08-15T23:00:18.147537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-19T12:44:37.940022Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-15T23:00:18.153988Z","title":"Powerinfer-2: Fast large language model inference on a smartphone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.153988Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:26dd275d93578db223b05c6c80ef153715285396d3e3d8ede6aece0bacb2cf54","observation_id":"fc9a2071-2c3c-4899-ad54-d6cbf007e740","resolution":{"observed_at":"2026-08-15T23:00:18.153988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.161527Z","title":"and Ananiadou, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.161527Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:a0830a41dc898154998ccbd1abd846b4e9ab1c2cf0322ab51667d60ff1c814f3","observation_id":"9f415b45-5a5a-40e4-9337-3a562c093362","resolution":{"observed_at":"2026-08-15T23:00:18.161527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-16T14:21:06.240224Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-08-15T23:00:18.167395Z","title":"ReLU ^ 2 wins: Discovering efficient activation functions for sparse llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.167395Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:8c171f590d1e8ef1549cd5d29197d11e6fabf9742623192e13bcb8412d33dec2","observation_id":"cc91911b-4e65-4197-9ca3-932ce986b3eb","resolution":{"observed_at":"2026-08-15T23:00:18.167395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:00:18.175589Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T23:00:18.175589Z"},"links":{"citing_paper":"/paper/2505.05950"},"observation_digest":"sha256:491d42480408bb4c7b8e267ddee69dc7c4ca39b25bf15bfaabd3180ff30e25d5","observation_id":"9ccd1920-6cc0-40bd-85c3-af1cdb5f9d27","resolution":{"observed_at":"2026-08-15T23:00:18.175589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05950","last_updated":"2025-05-12T03:29:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T01:38:01.563506Z","submitted_at":"2025-05-09T10:53:47Z","title":"FloE: On-the-Fly MoE Inference on Memory-constrained GPU"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2505.05950."}