{"as_of":"2026-08-15T16:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe7b14021d653517c2f97ae18f40cc891f87cb96dc686d61cbb8b4de75b2a3a4","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:55:54.179967Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:18:55.137694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06888","snapshot_observed_at":"2026-08-01T21:09:07.413164Z","title":"Klotski: Efficient mixture-of-expert inference via expert-aware multi-batch pipeline, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16184","last_updated":"2026-07-17T17:58:29Z","snapshot_observed_at":"2026-08-05T03:58:48.412708Z","submitted_at":"2026-07-17T17:58:29Z","title":"PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:09:07.413164Z"},"links":{"cited_paper":"/paper/2502.06888","citing_paper":"/paper/2607.16184"},"observation_digest":"sha256:01e5d40a2414e2343d6cabb3dcb38aba65795f137a73c861312190d0d4c18db6","observation_id":"b8cfa569-b997-4d2e-8566-6a2f79b8da59","resolution":{"observed_at":"2026-08-01T21:09:07.413164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06888","snapshot_observed_at":"2026-08-02T10:18:55.137694Z","title":"InProceedings of the 39th International Conference on Machine Learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24787","last_updated":"2026-07-30T11:13:04Z","snapshot_observed_at":"2026-08-09T05:23:41.747289Z","submitted_at":"2026-06-24T04:53:00Z","title":"SpecPrefetch: Parameter-Efficient Expert Prefetching for Sparse MoE Foundation Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T10:18:55.137694Z"},"links":{"cited_paper":"/paper/2502.06888","citing_paper":"/paper/2607.24787"},"observation_digest":"sha256:4ff0731eee2b7c796c89107e4bde174879e8f0f4153458d7942e57ab16b7125e","observation_id":"9200c61e-ff8a-4cbd-8ab1-6e017ec13f5d","resolution":{"observed_at":"2026-08-02T10:18:55.137694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06888/citation-record","integrity":"/paper/2502.06888/integrity","json":"/paper/2502.06888/citation-record.json","paper":"/paper/2502.06888"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T17:55:53.972786Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.972786Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:3f0892e10082ca1d3bca00bec067e863ce83c20166940d6e6da870875bfc2f3d","observation_id":"0ef96a6d-4d34-43b9-a9ab-1f8e344c297a","resolution":{"observed_at":"2026-08-08T17:55:53.972786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.835104Z","title":null,"venue":null,"work_id":"aa3a582a-a92b-4388-8930-40460cc720de","year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.977428Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:3703b998f1f6b902f20ef813a694febcecf4e4cf3bd8cc9c5a0595731eb7cdb0","observation_id":"1a94c703-675e-437f-925b-0f60fc184649","resolution":{"observed_at":"2026-08-08T17:55:54.839394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.821685Z","title":null,"venue":null,"work_id":"f76aad9c-0975-4298-ba82-9bc0979e9c4e","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.981537Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:313948f32ba3dd27d5eab8baeb36c4d12c0ed1d5bfd2bd5b0a7a1212e960c245","observation_id":"b7920495-143b-4492-97b1-9b1894a644ee","resolution":{"observed_at":"2026-08-08T17:55:54.825897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:53.985624Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.985624Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:e9ab530137c38308708c16a5c95139de7e164e44e6059b2406a1055b2b839263","observation_id":"074346d6-7415-4129-878b-dd37582f0fc5","resolution":{"observed_at":"2026-08-08T17:55:53.985624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-08T17:55:53.989609Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.989609Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:fd20e5fc93e4d8e33b28be161587f091475458b2a72b5f10acb3ba5185bdf784","observation_id":"0c4c9ff6-f8e7-4997-a1e5-45a01bcc93b7","resolution":{"observed_at":"2026-08-08T17:55:53.989609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T17:55:53.994050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.994050Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5603841f8783187993c4b541a0b3ab6d9b81fc84194341cf8814b2e1fdcafc19","observation_id":"3f1b0cd1-8d68-490a-884a-4d81a6bd0aa5","resolution":{"observed_at":"2026-08-08T17:55:53.994050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:53.998912Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:53.998912Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:0d0dca04d425ebad19057524b036a6bb397fb0ea9dd4118030211596f858aad8","observation_id":"7a23ba02-97f6-4c70-bbca-da1a1394d73e","resolution":{"observed_at":"2026-08-08T17:55:53.998912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18859","last_updated":"2024-05-17T23:33:23Z","snapshot_observed_at":"2026-08-13T09:06:07.570364Z","submitted_at":"2023-10-29T01:08:55Z","title":"SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models","version":2},"cited_work":{"arxiv_id":"2310.18859","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18859","snapshot_observed_at":"2026-08-08T17:55:54.454031Z","title":"SiDA-MoE: Sparsity-Inspired Data-Aware Serving for Efficient and Scalable Large Mixture-of-Experts Models","venue":"cs.LG","work_id":"01c9a486-6086-4aac-a4cf-27957fb2c534","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.006941Z"},"links":{"cited_paper":"/paper/2310.18859","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:cabf9f09d598671fe72a179a5b8326467c852034cb786a575a444df61e8c520c","observation_id":"b34b1bb8-ba6b-420f-a049-80e576840b72","resolution":{"observed_at":"2026-08-08T17:55:54.460747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17238","last_updated":"2023-12-28T18:58:13Z","snapshot_observed_at":"2026-08-14T00:47:18.331408Z","submitted_at":"2023-12-28T18:58:13Z","title":"Fast Inference of Mixture-of-Experts Language Models with Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17238","snapshot_observed_at":"2026-08-08T17:55:54.011111Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.011111Z"},"links":{"cited_paper":"/paper/2312.17238","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:513a5c4b2db6bb37c550b48edf62bbacc45f131b24367d540188956d1e8cfb8b","observation_id":"f5067132-b344-48c8-9b72-3580ed10c4d3","resolution":{"observed_at":"2026-08-08T17:55:54.011111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.014987Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.014987Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:954c2a97ea78b8890374c5dd971e33d396775b4fd5540ed8335e035c93126733","observation_id":"1d0d65fb-3ec1-41d5-83a5-50e04574865d","resolution":{"observed_at":"2026-08-08T17:55:54.014987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.782201Z","title":null,"venue":null,"work_id":"a88f298b-4ac0-4ac8-8dd6-bf288f46aba6","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.018729Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:6975c048bae22ecf2ca2b4a0e50ee5a42e9de84eb9e32362d2d171b565e7a7f9","observation_id":"853d811d-c72c-42c9-bba4-d5d43cdbb1be","resolution":{"observed_at":"2026-08-08T17:55:54.786223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-08T17:55:54.022408Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.022408Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:903164d406dc6dcf2ef87f3d86082036abcc6f35f060a4c5d095f4dbb12e9512","observation_id":"ba7e8c3f-6f5a-4b56-a130-708c6edc4eef","resolution":{"observed_at":"2026-08-08T17:55:54.022408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.026213Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.026213Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:7761cc26050ff19be9eb7dee2cb15b29c6cec972dd2634e3df10e33eaf969f9f","observation_id":"50092783-68ea-4ced-b90f-c85bfe8f7477","resolution":{"observed_at":"2026-08-08T17:55:54.026213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.747716Z","title":null,"venue":null,"work_id":"c560e55a-59e7-4303-b8d7-a546adb75a82","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.034378Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:f27b275444ec1665ae003f2d3a8d4e9bde72394c221c4f86f0dbb4f9fd63369a","observation_id":"c2c1b2f1-3caa-4084-a0e0-a75a9791898d","resolution":{"observed_at":"2026-08-08T17:55:54.751724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.734622Z","title":null,"venue":null,"work_id":"e216bf7b-3c34-43c4-b28b-084a6522b71f","year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.038149Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:b72fc9a4d56792cb15fc27608757c9e34dbe9199b99e26eb97ec0259236de88d","observation_id":"7dc608f5-83e9-4876-a87d-9ae75b0b4bf0","resolution":{"observed_at":"2026-08-08T17:55:54.738882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-08-13T10:02:11.727756Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-08T17:55:54.042509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.042509Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:e40b1d7966c18c29f64ec7594cb358d494aa3ab2183607086585aaaf27ae4e29","observation_id":"cca8c0a0-3680-428a-9ec0-d540affbe1ac","resolution":{"observed_at":"2026-08-08T17:55:54.042509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.721127Z","title":null,"venue":null,"work_id":"51d1715a-1d52-4a23-97dd-2bba8df56f2c","year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.046993Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:e8beffe22f12b3dc1d82afe1659eb1185c0aa61f6f6956ec8e90d91f891b9969","observation_id":"f579edf9-58d3-4158-9784-dca19793ab32","resolution":{"observed_at":"2026-08-08T17:55:54.725625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.051424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.051424Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:1ac539d67d6122b1236bc291dc1924fc6ef57db386e498f538b3eb124cade73f","observation_id":"88ebd988-8df7-4a61-959e-bb7a0b28f68b","resolution":{"observed_at":"2026-08-08T17:55:54.051424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T17:55:54.055733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.055733Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:95a7a08ed01c66ad6aa2506a6ef3a76122ace9249baecf41f0c1835310b042c3","observation_id":"9d0a20a1-2833-44cc-89dd-30f4d1403fd6","resolution":{"observed_at":"2026-08-08T17:55:54.055733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07033","last_updated":"2025-05-01T09:58:34Z","snapshot_observed_at":"2026-08-13T13:55:10.686817Z","submitted_at":"2024-02-10T19:54:08Z","title":"Fiddler: CPU-GPU Orchestration for Fast Inference of Mixture-of-Experts Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07033","snapshot_observed_at":"2026-08-08T17:55:54.060149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.060149Z"},"links":{"cited_paper":"/paper/2402.07033","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:4fea4295098cfc193f1be9060cbe7af54f3e8e36538090244620dc2498cd2f3e","observation_id":"9b9f8d09-ed6f-4bfd-bf6f-9d55235cdc6e","resolution":{"observed_at":"2026-08-08T17:55:54.060149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02410","last_updated":"2023-10-03T20:11:23Z","snapshot_observed_at":"2026-08-15T10:20:33.990744Z","submitted_at":"2023-10-03T20:11:23Z","title":"Mixture of Quantized Experts (MoQE): Complementary Effect of Low-bit Quantization and Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02410","snapshot_observed_at":"2026-08-08T17:55:54.064593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.064593Z"},"links":{"cited_paper":"/paper/2310.02410","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:0b6b59cf4dabb65fc31e3fc8a7260eb7fdddfb130b9eb73def8a4207be302acf","observation_id":"4ec2ac85-67b6-4824-9958-65a005ddc5a5","resolution":{"observed_at":"2026-08-08T17:55:54.064593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-08T17:55:54.069319Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.069319Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:d819f8ef9e09a0e620e2e3eb454ef15c92d1700fd1d66ba7e6f16b5e10ee20bb","observation_id":"d9b0d394-7fd8-46d4-b558-4a100ba97f62","resolution":{"observed_at":"2026-08-08T17:55:54.069319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.699305Z","title":null,"venue":null,"work_id":"aa3e4b6f-3c7f-4615-9559-369e72bcdb73","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.073528Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:6d861813302fb46588e8e474eb1ff858866859fca1a272bd0db249f9d339bb68","observation_id":"04c39c6b-8dd7-4924-81e4-a83b86d9ca98","resolution":{"observed_at":"2026-08-08T17:55:54.703495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-08T17:55:54.077454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.077454Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:f02c64d11c74bcd8b026e919f2196377050baad6c8733a316a5ce925a134fdd2","observation_id":"a8635c0a-9891-4e9b-ae76-cfe348380a88","resolution":{"observed_at":"2026-08-08T17:55:54.077454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.685701Z","title":null,"venue":null,"work_id":"00949c5a-852d-4b0f-9a86-1eb733db321b","year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.081513Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:473d2b9499c96aa719dcc725c225897014654f42bc211c801fbe53c0d2722131","observation_id":"9bad0993-f89f-43fc-ab0a-bcaa7334cf37","resolution":{"observed_at":"2026-08-08T17:55:54.689960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.085588Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.085588Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:c97ac8bfae1ea3f398d7407e4aa5500ff8375c18d387c493c597e08a2ce187a6","observation_id":"ff5671d5-65f1-4049-811d-e4ef6b56e923","resolution":{"observed_at":"2026-08-08T17:55:54.085588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.089521Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.089521Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:9ff9896c2d6e21a753d605657b304a1df21dc3e990373ded4afa77ed475954e3","observation_id":"5baa16e9-5350-4773-8001-785260aa7968","resolution":{"observed_at":"2026-08-08T17:55:54.089521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.098055Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.098055Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5336b145f79287d98714755a4f73523759987805b26359ea04a99ce6ed4ec4d7","observation_id":"24a5b005-7f9c-4ee3-8d9b-eb1aaf6bc9b2","resolution":{"observed_at":"2026-08-08T17:55:54.098055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.646160Z","title":null,"venue":null,"work_id":"ce4c3d73-233b-48a9-97d9-a323a4baf8ca","year":2020},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.101926Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:90705a794ee7be097b6d70f4f2305279964f010a1349a53bb2be531ec4025f03","observation_id":"cde6677a-eabc-4417-bcfc-7f48742e1d5b","resolution":{"observed_at":"2026-08-08T17:55:54.650309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.632315Z","title":null,"venue":null,"work_id":"0e0587dc-0ed1-45b7-b335-576ec818d568","year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.105826Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:fbf97939f7c04eef667d925c4830af52e4c131470ed7d31eb27dac9a666aaf91","observation_id":"caf2e6aa-d1a3-4f43-ad75-b1a6486d50a4","resolution":{"observed_at":"2026-08-08T17:55:54.636902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.109645Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.109645Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:62e2f289a038bd7d528fbc93bc44f1c073011f6dff0b1fe2cfecc0641e7d3427","observation_id":"9b3c4c51-ca3d-4d9d-8244-2fdf19e17d02","resolution":{"observed_at":"2026-08-08T17:55:54.109645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.113690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.113690Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:5a37b46f55b87d87c6855b42f16271da76cbde364e4d3b2d310ea18fbb33e39d","observation_id":"03c07cf7-1cfa-4a5f-966b-42853903912a","resolution":{"observed_at":"2026-08-08T17:55:54.113690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-08T17:55:54.122296Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.122296Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:d4809a00a5de7fdf9e1bcb2b49d87ab30c65221741c04069818f35411764c8a5","observation_id":"bfc40be9-2324-462d-bef0-697870358b35","resolution":{"observed_at":"2026-08-08T17:55:54.122296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.126488Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.126488Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:babdf93448e9e07c9a7f26de4fe19290a51ceb9c4df1af4e50b6035dce2a70f1","observation_id":"15fb459e-cb42-4086-ab1e-b8bdd8d4b851","resolution":{"observed_at":"2026-08-08T17:55:54.126488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T17:55:54.130426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.130426Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:76f4c6043b47f3099dcef5b96bb6cb4506169d3afe3f7ee20c4bd20eca529da9","observation_id":"c788a648-df29-4a4a-be3f-21ef38083d93","resolution":{"observed_at":"2026-08-08T17:55:54.130426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.134360Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.134360Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:ed76a27a282bda1fb695e7c71163f8355143539f6ca1574c6c6766e839f89de6","observation_id":"d8a05a24-72ee-4c79-a3ff-7105d6ef1eab","resolution":{"observed_at":"2026-08-08T17:55:54.134360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-08T17:55:54.138113Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.138113Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:73607d5344523d42fe502b074f2dac112beba767db327925e4ff5f125f5ff994","observation_id":"730e154d-08d7-4eed-8022-d193452619f9","resolution":{"observed_at":"2026-08-08T17:55:54.138113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.142216Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.142216Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:27640837152bd5ea42f07ea3e705f0d8970e4cdbda6baa811eb32a39686b84fd","observation_id":"936bbc8c-1a5a-4ce4-ad59-f4fbb40eba25","resolution":{"observed_at":"2026-08-08T17:55:54.142216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-08T17:55:54.146007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.146007Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:df6675606ac30bffeda43e366f25782aa4ce0b11ab53c349126ff0e536adf3e7","observation_id":"db234230-35b0-476c-bc53-c8227ea633ad","resolution":{"observed_at":"2026-08-08T17:55:54.146007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08092","last_updated":"2024-09-23T07:37:34Z","snapshot_observed_at":"2026-08-13T04:42:19.813596Z","submitted_at":"2024-01-16T03:35:26Z","title":"A Survey of Resource-efficient LLM and Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08092","snapshot_observed_at":"2026-08-08T17:55:54.150115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.150115Z"},"links":{"cited_paper":"/paper/2401.08092","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:b95c61050552c1da8aa9589084bd08dc0bea94a4721d2039c3bc3a5496efc32d","observation_id":"f14b5346-b03c-4a31-a30c-b1521795488e","resolution":{"observed_at":"2026-08-08T17:55:54.150115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.561363Z","title":null,"venue":null,"work_id":"9a594732-ae92-40f2-8957-4b33243fcefa","year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.154285Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:2f6eb2b6733229da47268cf29ab5380a5ab70893726fe7cf1a3d2eb348ff757f","observation_id":"e0da7699-1bc7-4bc9-81e5-ffacf4c2e358","resolution":{"observed_at":"2026-08-08T17:55:54.565525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-13T04:32:45.849412Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-08T17:55:54.158078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.158078Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:87ac543e7f87f55c21153cd93693b08fd38666375bd4c2fe197025b115bb3246","observation_id":"fc2d7ce5-5f3f-4b24-b6ff-ff36e2363d91","resolution":{"observed_at":"2026-08-08T17:55:54.158078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14361","last_updated":"2025-03-12T18:14:21Z","snapshot_observed_at":"2026-08-13T04:34:35.314198Z","submitted_at":"2024-01-25T18:07:50Z","title":"MoE-Infinity: Efficient MoE Inference on Personal Machines with Sparsity-Aware Expert Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14361","snapshot_observed_at":"2026-08-08T17:55:54.162523Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.162523Z"},"links":{"cited_paper":"/paper/2401.14361","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:099fdd16fde40e8b81e7405ee7b823a1eb309d542355dbac5c0c3359edfb96dc","observation_id":"6e448380-db6b-4462-b9ba-53343266b24c","resolution":{"observed_at":"2026-08-08T17:55:54.162523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.547608Z","title":null,"venue":null,"work_id":"b8f11b55-d9ca-41a5-a7a8-f0245a2101e5","year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.167004Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:31947360d80aa2eb772e72fac08d0236c773cdbe6e4ac4ca34a588f2725a6904","observation_id":"5bbc055c-837b-4aec-9a16-c4dcf79bd7c7","resolution":{"observed_at":"2026-08-08T17:55:54.552208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.534115Z","title":null,"venue":null,"work_id":"6625ef0e-f4e2-4d7c-ad71-85716522ce4c","year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.171246Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:e464fb9ac4f9c84e00145c95b8fbf66814ec37a86c335970ac9f1a699a09d85c","observation_id":"e75b8677-bad7-4f08-aef7-88ef2591d3f3","resolution":{"observed_at":"2026-08-08T17:55:54.538402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-08T17:55:54.175315Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.175315Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:8b8e46ed2344c086a13bfa88da186b92a45641b90e43ba4de959c9e974d12fb2","observation_id":"a360eaac-b163-450b-a0f0-143441ed0a58","resolution":{"observed_at":"2026-08-08T17:55:54.175315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.179967Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.179967Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:0400702c6ed519472f30e4ec1a8f26e5a3dcff7d8276c708923034da646951ce","observation_id":"db854cf0-e973-445c-8fa5-f44a77bdb5e6","resolution":{"observed_at":"2026-08-08T17:55:54.179967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-08T17:55:54.093526Z","title":"arXiv:1609.07843 [cs.CL]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.093526Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:301ac79f18488db3b4b0cd6a475dce392b3af7b0953e8ed9bc81c40c07107217","observation_id":"99ddaae9-b482-4baf-ae7f-540e672ac6f5","resolution":{"observed_at":"2026-08-08T17:55:54.093526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T17:55:54.002913Z","title":"arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.002913Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:c967a9a46aa4b0e78b4f12f942da6bb865b8c7a850b8ab3dc0dfe186ca23c99d","observation_id":"817973ae-7511-4d09-80e6-b858b8fa326f","resolution":{"observed_at":"2026-08-08T17:55:54.002913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.600668Z","title":"In 2021 USENIX Annual Technical Conference (USENIX ATC 21)","venue":null,"work_id":"3301a126-0c7c-4e83-8704-e3baa2445952","year":2021},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.118426Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:533104bdd2f62ab7aa8ee7e250abaaf65f7ef124ce5dcc4972b7df63cb9d5e80","observation_id":"138e7a76-e285-484b-a41f-cdca78d75b64","resolution":{"observed_at":"2026-08-08T17:55:54.605201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:55:54.760702Z","title":"https://github.com/huggingface/accelerate","venue":null,"work_id":"1cf775e5-8f8e-4d20-8010-235557bf08a4","year":null},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.030119Z"},"links":{"citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:422d4c49cd27f8a6be8b7235b1166fd44bc89115356d7ee8b3208f9292bf392f","observation_id":"60e909b1-8739-457f-b9bf-80e99fe233e9","resolution":{"observed_at":"2026-08-08T17:55:54.764905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T00:29:36.978138Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 2 inbound Pith citation observations for arXiv:2502.06888."}