{"as_of":"2026-08-21T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15efd2c7c1239a6199fd0d1762d846bc9807a7153e7ff217d0ae924f827da4ac","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:45:12.253030Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.06481/citation-record","integrity":"/paper/2505.06481/integrity","json":"/paper/2505.06481/citation-record.json","paper":"/paper/2505.06481"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T22:45:12.108866Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., 9 QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.108866Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:6abf62df5c90c5c3fb3e228314322555bec902b9d31550adc1bc0f67de424616","observation_id":"3cb88a68-5a9c-499f-a41d-47a13801a8cd","resolution":{"observed_at":"2026-08-15T22:45:12.108866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09497","last_updated":"2024-07-12T15:45:57Z","snapshot_observed_at":"2026-08-19T19:13:00.772398Z","submitted_at":"2024-02-14T15:47:46Z","title":"Instruction Tuning for Secure Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09497","snapshot_observed_at":"2026-08-15T22:45:12.140853Z","title":"URL http://dx.doi.org/ 10.18653/v1/D19-5409","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.140853Z"},"links":{"cited_paper":"/paper/2402.09497","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:17be58cc6932a6b3411d6c350ec904e10151768815862a70ab2a4bfaca990917","observation_id":"2977fc75-2541-4c08-9382-1b5a6ebbfae7","resolution":{"observed_at":"2026-08-15T22:45:12.140853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14417","last_updated":"2024-09-09T16:34:00Z","snapshot_observed_at":"2026-08-19T20:00:28.021008Z","submitted_at":"2024-07-19T15:42:49Z","title":"Mixture of Experts with Mixture of Precisions for Tuning Quality of Service","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14417","snapshot_observed_at":"2026-08-15T22:45:12.154979Z","title":"Mixture of experts with mixture of precisions for tuning quality of service","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.154979Z"},"links":{"cited_paper":"/paper/2407.14417","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f0829b384cf5d8ea6f9b8aa04962ebffc4736e4466ed72508d59902bbc2aca6b","observation_id":"926e7fdb-af0b-4f6d-a7fd-264c558c3acf","resolution":{"observed_at":"2026-08-15T22:45:12.154979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-08-14T19:36:09.254749Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-15T22:45:12.159574Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.159574Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:3fb317435eedd0173f1bcef6f751c3d2dfbe03c21c38e782a57d391f8584ab9c","observation_id":"0ad6bc08-7f39-478d-90c6-43f97f14df6f","resolution":{"observed_at":"2026-08-15T22:45:12.159574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09849","last_updated":"2025-05-21T23:53:00Z","snapshot_observed_at":"2026-08-16T16:07:30.940052Z","submitted_at":"2022-12-19T20:46:43Z","title":"Dataless Knowledge Fusion by Merging Weights of Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09849","snapshot_observed_at":"2026-08-15T22:45:12.168712Z","title":"Data- less knowledge fusion by merging weights of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.168712Z"},"links":{"cited_paper":"/paper/2212.09849","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f5d25c6f7f211474a74d7a9640c9bb361c9d9cc55ae25e26ce451c0e82179583","observation_id":"67993dd1-3c23-42bc-81de-66d53d5ebf02","resolution":{"observed_at":"2026-08-15T22:45:12.168712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10465","last_updated":"2021-09-22T00:57:46Z","snapshot_observed_at":"2026-08-20T10:44:03.896048Z","submitted_at":"2021-09-22T00:57:46Z","title":"Scalable and Efficient MoE Training for Multitask Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10465","snapshot_observed_at":"2026-08-15T22:45:12.177984Z","title":"J., Awan, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.177984Z"},"links":{"cited_paper":"/paper/2109.10465","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:afa885c7f94c8de3d35ba74a8be46359874c8e2ae0d5f3af25ad9e2ee3343c16","observation_id":"180a2d0f-3b78-4c18-a98c-20115a7492bd","resolution":{"observed_at":"2026-08-15T22:45:12.177984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.972094Z","title":"K., El-Araby, E., and El-Ghazawi, T","venue":null,"work_id":"345bdffd-a0c0-4baf-8088-95f70761bd76","year":2011},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.182655Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:2323ecc085657bbfb73bb20c3d7c6f8751e37ae6121115f2463af34621c74cf2","observation_id":"bd693f6d-3a48-4236-8e8e-3dc39cbb3c5f","resolution":{"observed_at":"2026-08-15T22:45:12.977588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-15T22:45:12.191723Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.191723Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:a734c2e245e86afcefc9bec67cab3a5a7a2b2fa89c09106ff1ac937ec489f0ca","observation_id":"1fc3f0ee-fe10-4aa9-a96a-fa192e03b7b9","resolution":{"observed_at":"2026-08-15T22:45:12.191723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.956632Z","title":"A., MacIntyre, R., Bies, A., Ferguson, M., Katz, K., and Schasberger, B","venue":null,"work_id":"f0ed885d-4ca8-4071-afa2-08ce95ea9d39","year":1994},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.196486Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:0fbce85d33f3b87ccabbb04a63c6420750b92a094c80c64892b0cffc241a6a3c","observation_id":"e50477da-2adb-4129-8311-01b9b4a8f7cb","resolution":{"observed_at":"2026-08-15T22:45:12.961418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-15T22:45:12.201264Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.201264Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:0d39e88f50da313706fe7554e4ae0f342fe51c13ffcbf2690763b43564ac2a7a","observation_id":"e75e35e0-ff73-4501-ab77-ae34bc89b0ca","resolution":{"observed_at":"2026-08-15T22:45:12.201264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11530","last_updated":"2024-05-19T11:55:48Z","snapshot_observed_at":"2026-08-20T10:44:07.260791Z","submitted_at":"2024-05-19T11:55:48Z","title":"Learning More Generalized Experts by Merging Experts in Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11530","snapshot_observed_at":"2026-08-15T22:45:12.210312Z","title":"Learning more generalized experts by merg- ing experts in mixture-of-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.210312Z"},"links":{"cited_paper":"/paper/2405.11530","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f3933a50abe63d1c769e4e30be5ddd1c15df0b8859891a5265fda4a95c2dd2ae","observation_id":"f706776d-9051-4c0e-9b59-a2ef268d3098","resolution":{"observed_at":"2026-08-15T22:45:12.210312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T22:45:12.214771Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.214771Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:2008bd503bfef3a84149a6d5bf3e1d1add227af10af3622aaa05fec70409df62","observation_id":"28b23937-7fa0-437e-a296-b90d895a38f0","resolution":{"observed_at":"2026-08-15T22:45:12.214771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1220.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.553357Z","title":"Wortsman, M., Ilharco, G., Gadre, S","venue":null,"work_id":"888d72a2-828a-4be0-9e28-2e7cdf63912e","year":2024},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.228731Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f28d2395b8799d92e927b74fcb16758c27244771c1fad6c42460f5b28058908d","observation_id":"675643da-3237-4297-8020-47c5b86e76c0","resolution":{"observed_at":"2026-08-15T22:45:12.562004Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-20T12:24:17.997422Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-15T22:45:12.233874Z","title":"Moe- infinity: Activation-aware expert offloading for efficient moe serving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.233874Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:37208f760f3c2616dc0d770e8a9edb893c44c0edfea341ae25227ce99dee687a","observation_id":"97984be8-d51f-433c-b35f-b5b268f12e12","resolution":{"observed_at":"2026-08-15T22:45:12.233874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-16T20:27:57.883150Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-15T22:45:12.238873Z","title":"Resolving interference when merging models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.238873Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:2369203585fec2a0f31746812329b29d1ffad0ef475fc64383f85d299a5b4fb3","observation_id":"90bcabaa-a40b-4ee2-80a9-1e0eaeb73d1f","resolution":{"observed_at":"2026-08-15T22:45:12.238873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01016","last_updated":"2024-11-01T20:37:58Z","snapshot_observed_at":"2026-08-16T13:03:40.201366Z","submitted_at":"2024-11-01T20:37:58Z","title":"MoE-I$^2$: Compressing Mixture of Experts Models through Inter-Expert Pruning and Intra-Expert Low-Rank Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01016","snapshot_observed_at":"2026-08-15T22:45:12.243625Z","title":"Moe-i2: Compressing mixture of experts models through inter- expert pruning and intra-expert low-rank decomposition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.243625Z"},"links":{"cited_paper":"/paper/2411.01016","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:d5d167db60d09f6092e1781975191b5a051e77c07c73e85ac48e01519f4a2161","observation_id":"4635aa8b-5752-4e4d-be90-438bdaba0c1d","resolution":{"observed_at":"2026-08-15T22:45:12.243625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14389","last_updated":"2024-10-18T11:49:40Z","snapshot_observed_at":"2026-08-18T21:12:38.128880Z","submitted_at":"2024-10-18T11:49:40Z","title":"SurgeryV2: Bridging the Gap Between Model Merging and Multi-Task Learning with Deep Representation Surgery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14389","snapshot_observed_at":"2026-08-15T22:45:12.248175Z","title":"Surgeryv2: Bridging the gap be- tween model merging and multi-task learning with deep representation surgery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.248175Z"},"links":{"cited_paper":"/paper/2410.14389","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:2fba6423ec9b583c925d2e7626d61ec21717df81aa16fcdae67c4d199d06e82f","observation_id":"51732976-2fb8-4f82-a106-ec094726bdf9","resolution":{"observed_at":"2026-08-15T22:45:12.248175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-08-20T11:07:11.601985Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-15T22:45:12.253030Z","title":"J., Hassan, H., Zhang, R., Zhao, T., and Gao, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.253030Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:e4f0beb7842dad39c7ef56a264e0a0096fbf5ae6656d6cfded7a2575d7565132","observation_id":"4cbcd22f-5233-4ee4-ac32-627f4265ded2","resolution":{"observed_at":"2026-08-15T22:45:12.253030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T22:45:12.164099Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.164099Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:0c0eb6557aaaebb8beab05963f6ae8209e83b082e2e7378671fe26571b985f13","observation_id":"d90afda7-6451-4fa6-a7cc-66e96165ae23","resolution":{"observed_at":"2026-08-15T22:45:12.164099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-19T12:47:59.699310Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-15T22:45:12.173343Z","title":"Kamahori, K., Gu, Y ., Zhu, K., and Kasikci, B","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":1994,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.173343Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:cb13b80e66c8af5e3fd38f5e6c061d7188a30cdea17852a6da57fa2fac18dcd2","observation_id":"ebd18d54-e81c-405d-a247-9128159767ba","resolution":{"observed_at":"2026-08-15T22:45:12.173343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-19T12:48:02.319950Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-15T22:45:12.135322Z","title":"and Mazur, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.135322Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:566f794bdb4e1294049d0647fba73e31f9a0d4d0fe4fcdb34c7e330f53680ff1","observation_id":"1e9d518d-105e-415c-bf48-de4c9ac13204","resolution":{"observed_at":"2026-08-15T22:45:12.135322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-16T14:21:05.484802Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-15T22:45:12.150327Z","title":"Billm: Pushing the limit of post-training quantization for llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.150327Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:f970448da33d0327b9651b3a13d8b598679ae2f654a73a4e36c84eccea768951","observation_id":"e560976b-51aa-4a73-8b09-283b64fb4c1c","resolution":{"observed_at":"2026-08-15T22:45:12.150327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03888","last_updated":"2021-10-25T06:24:41Z","snapshot_observed_at":"2026-08-20T10:44:29.643255Z","submitted_at":"2021-10-08T04:24:51Z","title":"M6-10T: A Sharing-Delinking Paradigm for Efficient Multi-Trillion Parameter Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03888","snapshot_observed_at":"2026-08-15T22:45:12.187026Z","title":"M6-10t: A sharing- delinking paradigm for efficient multi-trillion parameter pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.187026Z"},"links":{"cited_paper":"/paper/2110.03888","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:d59283288fa38b61f29d4de05b89b21e649408c819432bd9edb7d49aff995ddd","observation_id":"1c64c3ed-d511-460e-a6db-c20dfd1dabe7","resolution":{"observed_at":"2026-08-15T22:45:12.187026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05089","last_updated":"2024-04-07T22:13:43Z","snapshot_observed_at":"2026-08-19T17:44:33.049704Z","submitted_at":"2024-04-07T22:13:43Z","title":"SEER-MoE: Sparse Expert Efficiency through Regularization for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05089","snapshot_observed_at":"2026-08-15T22:45:12.205697Z","title":"Seer-moe: Sparse expert efficiency through regularization for mixture-of-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.205697Z"},"links":{"cited_paper":"/paper/2404.05089","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:e129831ddfc90b88b26dc08affe10f2c315f6679dda163e23b44d23549324ee1","observation_id":"58335d6e-ac25-4847-819c-062afed78d62","resolution":{"observed_at":"2026-08-15T22:45:12.205697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21804","last_updated":"2024-10-29T07:16:31Z","snapshot_observed_at":"2026-08-20T10:44:04.986650Z","submitted_at":"2024-10-29T07:16:31Z","title":"Efficient and Effective Weight-Ensembling Mixture of Experts for Multi-Task Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21804","snapshot_observed_at":"2026-08-15T22:45:12.219620Z","title":"Efficient and effec- tive weight-ensembling mixture of experts for multi-task model merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.219620Z"},"links":{"cited_paper":"/paper/2410.21804","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:cbe3f4e13960bbb2ebeafc5d4a4b0f9776a3a6e4df1df71ae0036ef888839c65","observation_id":"2f83e62e-312f-41df-b7c3-fb75f1f40703","resolution":{"observed_at":"2026-08-15T22:45:12.219620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:45:12.940267Z","title":"Exploring in-memory accelerators and fp- gas for latency-sensitive dnn inference on edge servers","venue":null,"work_id":"c8432f55-e524-48dd-8c49-a2ec86a9182f","year":2024},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.224258Z"},"links":{"citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:42521c39cb0b639dc2e6e4617b5e1142194318e73a13bc9496519d2ea0c8b688","observation_id":"7000e4ab-0d46-4197-a195-5babe867c87d","resolution":{"observed_at":"2026-08-15T22:45:12.946045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16646","last_updated":"2024-05-30T17:30:42Z","snapshot_observed_at":"2026-08-20T10:44:03.391300Z","submitted_at":"2024-05-26T17:52:58Z","title":"A Provably Effective Method for Pruning Experts in Fine-tuned Sparse Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16646","snapshot_observed_at":"2026-08-15T22:45:12.119688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.119688Z"},"links":{"cited_paper":"/paper/2405.16646","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:0482b1caa8309aec85b2c1ebfecec56aa677d517b63795b72b96da92aad8fc8e","observation_id":"a47a333e-07c6-4081-a2f7-b1d752c1d7cd","resolution":{"observed_at":"2026-08-15T22:45:12.119688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-15T22:45:12.125138Z","title":"Dettmers, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.125138Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:58702aad7b9411931b2e5c2f542b203dcebe007ec4f3c3f363853f2ff880b845","observation_id":"fcd730d3-e048-4e14-97a4-e59d216fa2a9","resolution":{"observed_at":"2026-08-15T22:45:12.125138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02396","last_updated":"2024-10-03T11:17:58Z","snapshot_observed_at":"2026-08-18T21:12:07.984829Z","submitted_at":"2024-10-03T11:17:58Z","title":"Parameter Competition Balancing for Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02396","snapshot_observed_at":"2026-08-15T22:45:12.130419Z","title":"K., Tang, H.-K., He, D., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.130419Z"},"links":{"cited_paper":"/paper/2410.02396","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:957a7da1e90742271712329de45451b74c4cda9860308a51f663ac78c1eff874","observation_id":"b72950c3-4cfe-439e-af6d-2931c5b715e3","resolution":{"observed_at":"2026-08-15T22:45:12.130419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T22:45:12.145498Z","title":"Measuring mas- sive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.145498Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:9da519d4deef77faa52e6daa2a1c3827d375bad2ce4eeb91f212df659dc26ed8","observation_id":"5ac90b88-ef90-4698-8c4e-5138cb000122","resolution":{"observed_at":"2026-08-15T22:45:12.145498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00277","last_updated":"2022-06-02T03:44:04Z","snapshot_observed_at":"2026-08-16T16:56:06.467083Z","submitted_at":"2022-06-01T07:09:01Z","title":"Task-Specific Expert Pruning for Sparse Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00277","snapshot_observed_at":"2026-08-15T22:45:12.114554Z","title":"Chen, T., Huang, S., Xie, Y ., Jiao, B., Jiang, D., Zhou, H., Li, J., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T22:45:12.114554Z"},"links":{"cited_paper":"/paper/2206.00277","citing_paper":"/paper/2505.06481"},"observation_digest":"sha256:54c0b36675bf7000146ceb896f3e77db7a5ee4ae38eacc2972617bc7e3224a07","observation_id":"3b4c9814-32b5-4088-869a-dafd627ad67b","resolution":{"observed_at":"2026-08-15T22:45:12.114554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.06481","last_updated":"2025-05-10T00:46:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T12:48:30.947001Z","submitted_at":"2025-05-10T00:46:04Z","title":"QoS-Efficient Serving of Multiple Mixture-of-Expert LLMs Using Partial Runtime Reconfiguration"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.06481."}