{"as_of":"2026-08-11T05:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16a286df10c4a0f80d962c4b44fd001514ee5aeea3310d5690cc71650af0cd24","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:57:32.963734Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T04:31:11.271729Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T04:33:03.804063Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"cited_work":{"arxiv_id":"2506.12417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12417","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HarMoEny: Efficient multi-gpu inference of MoE models","venue":null,"work_id":"109fcb4a-ff88-4b37-9040-81f001d543b6","year":2025},"citing_paper":{"arxiv_id":"2605.19945","last_updated":"2026-05-19T15:01:39Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:01:39Z","title":"GEM: GPU-Variability-Aware Expert to GPU Mapping for MoE Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T04:31:11.271729Z"},"links":{"cited_paper":"/paper/2506.12417","citing_paper":"/paper/2605.19945"},"observation_digest":"sha256:43d4a9449b2046386b53e8dc88b081f2da89ec7d190a173d62ef81bd0a32c7c0","observation_id":"0685dec3-b41b-42bf-afb6-58de81036b73","resolution":{"observed_at":"2026-05-20T04:33:03.808270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12417/citation-record","integrity":"/paper/2506.12417/integrity","json":"/paper/2506.12417/citation-record.json","paper":"/paper/2506.12417"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:57:32.813852Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.813852Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:b11fab22fc3db1b718875fc157a9a0405d8feea0cdcc9fb80226a2a89880979a","observation_id":"1b83d114-1784-493f-9690-744ac60e2df6","resolution":{"observed_at":"2026-08-07T00:57:32.813852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.500748Z","title":"Amazon EC2 update – inf1 instances with AWS inferentia chips for high performance cost-effective inferencing, 2019","venue":null,"work_id":"b0468393-fb99-4223-bee7-05420a44bd87","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.818850Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:fc137e862470b951aa76f0430e7b86b900c2d5cd79fa50080e691ca6a7999f7c","observation_id":"f80582c9-8953-4a5a-bc28-185de4c14044","resolution":{"observed_at":"2026-08-07T00:57:33.504866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.487886Z","title":"A neural probabilistic language model","venue":null,"work_id":"a73098f9-2675-4617-ae9e-bc0c8dbbd5a9","year":2000},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.822866Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:7e46175b7d1e678dc32a436523e45b3b028bee09d7e37a8c108f37ea5787d676","observation_id":"59dddad4-1d4c-4ed6-b0c5-62a42d571780","resolution":{"observed_at":"2026-08-07T00:57:33.491982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.474833Z","title":"Datacenter power and energy management: past, present, and future","venue":null,"work_id":"1bc4273a-ed1a-4a12-ac37-ad4c24b78165","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.827146Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:9e4cd145f44829f2734144b7d0f960ce33094797a76085e4260d01cfb88404d3","observation_id":"71b4bcfb-9f00-4e92-afa8-ad95ab622190","resolution":{"observed_at":"2026-08-07T00:57:33.479177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.831078Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.831078Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:cf67a89edd364bb977487d17cd2eee937c04c328648d101a0b89a2d540e1747e","observation_id":"d8ead566-47c9-44d8-9279-225b98678ce9","resolution":{"observed_at":"2026-08-07T00:57:32.831078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.453557Z","title":"Large scale distributed deep networks","venue":null,"work_id":"0fba71f5-8165-4b1c-aeae-4cd793b9c51e","year":2012},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.834897Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:4de123590ce4cc47ceff155225485037a023b8d0ff1de28141f3b5dfefd43750","observation_id":"2fe6c22e-b416-4b89-bbbe-cbcd728c75d7","resolution":{"observed_at":"2026-08-07T00:57:33.457504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.440883Z","title":"Quasar: Resource-efficient and qos-aware cluster management","venue":null,"work_id":"82fc9b71-a7e9-4ef9-91ea-45212ecaebf0","year":2014},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.839116Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:bd7ca7c55dd3bd85c3f06b989ec3a5d053927000d2c7c1e2792cae3cabd0e903","observation_id":"bf21b206-e2b7-45a7-a376-5c26f5da9c52","resolution":{"observed_at":"2026-08-07T00:57:33.444890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.427220Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"50a194e1-517a-4f12-880d-62d770a0c927","year":2022},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.842730Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:e7cbe6530ef07995574f0ef9da76e8902c39d4e8e29124eb7f1a378587456f80","observation_id":"bad8eb6c-46f3-481c-80fb-f768b78f85bb","resolution":{"observed_at":"2026-08-07T00:57:33.432026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.413809Z","title":"Acl 2019 fourth conference on machine translation (wmt19), shared task: Machine translation of news","venue":null,"work_id":"435c9f1f-9477-4649-8774-89a4521e2a46","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.846300Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:d4d2caa6d13a3d4b7b8f6dc275aaf49a87d43ce2d56c5519d1fd11465a4ea24a","observation_id":"c1678eaa-a4de-4c35-b151-fd9c69584ff5","resolution":{"observed_at":"2026-08-07T00:57:33.417764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.401041Z","title":"Megablocks: Efficient sparse training with mixture-of-experts","venue":null,"work_id":"9c2161b9-a854-4938-9ddd-b8cd69b8402e","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.850070Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:b990ee6b0e2109f1c331493ebefaecd4ae01f6b6d8b702aef6bdd354196450fa","observation_id":"46e54108-df6f-4716-a6b2-03918b500a69","resolution":{"observed_at":"2026-08-07T00:57:33.404964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04997","last_updated":"2019-11-12T16:32:38Z","snapshot_observed_at":"2026-08-08T00:52:49.189975Z","submitted_at":"2019-11-12T16:32:38Z","title":"Character-based NMT with Transformer","version":1},"cited_work":{"arxiv_id":"1911.04997","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.04997","snapshot_observed_at":"2026-08-07T00:57:33.080428Z","title":"Character-based NMT with Transformer","venue":"cs.CL","work_id":"29ae3d87-6e82-4d3b-836c-42814b5b7158","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.853759Z"},"links":{"cited_paper":"/paper/1911.04997","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:fdeb7df9e65f8383f4e3e0bcb7a1e2d11ce267abaca37fa55b95cdc257cd8315","observation_id":"482cdcd6-4f65-4613-aab7-5327551c3ef7","resolution":{"observed_at":"2026-08-07T00:57:33.086400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-10T06:33:13.988909Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-07T00:57:32.858076Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.858076Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:76656b8449149145b8c6eef2afaf0052fa5aa9aa7109b5de1136a65579ccbed1","observation_id":"d4340967-aa22-4a69-aad8-fd6b8cf1e4c5","resolution":{"observed_at":"2026-08-07T00:57:32.858076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.388640Z","title":"Fastermoe: Modeling and optimizing training of large-scale dynamic pre-trained models","venue":null,"work_id":"43f947e3-b9b9-4e42-87a4-fa6b9b5ca7cb","year":2022},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.862163Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:17b065ad069ae3bfb23c7e977b52e1f28f38f8069282cd0923845f3e45723c7b","observation_id":"97e82041-bfbd-4914-b069-7b631afd185a","resolution":{"observed_at":"2026-08-07T00:57:33.392572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.375736Z","title":"Tutel: Adaptive mixture-of- experts at scale","venue":null,"work_id":"af28f41a-d2ca-4e0c-bc24-d9969ef8a8d1","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.865806Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:30e2f80d8e869820489a3407837b3e32f2f6a85263a0b35746084923e4c23f82","observation_id":"5affdc3e-01fd-4096-a213-3589403847e8","resolution":{"observed_at":"2026-08-07T00:57:33.380243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.363050Z","title":"Adaptive mixtures of local experts","venue":null,"work_id":"4600cb2d-6c32-4f5f-b64b-ec9db598708d","year":1991},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.869364Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:88c7ec315b30637fe30beadf21fcda2548de42561a8e7f32dcd343b12ab5491f","observation_id":"eb3db8f3-6b32-46db-b5a8-175c2bbc2252","resolution":{"observed_at":"2026-08-07T00:57:33.367056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T00:57:32.872804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.872804Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:3521703474dbc24915441c7a704f0d19012cb1e7f52db5d9eb79ad846e7bc077","observation_id":"880a320b-7746-4f15-a62a-0d8f087a5101","resolution":{"observed_at":"2026-08-07T00:57:32.872804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T00:57:32.876451Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.876451Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:e1f306c0ee6dbb080b866b4907af94fe5529cbbf52a83a48d933673d7e8d727b","observation_id":"60a95c6e-66a4-40b7-ba63-0318e79fa7ca","resolution":{"observed_at":"2026-08-07T00:57:32.876451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.880325Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.880325Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:6cad8421db185fdcca961e9804b89f8ef2a26b8834b7c2d7226da21e57fc61b9","observation_id":"4915bd77-dafe-4b2c-8794-96d864e8cee6","resolution":{"observed_at":"2026-08-07T00:57:32.880325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.340973Z","title":"Subword regularization: Improving neural network translation models with multiple subword candidates","venue":null,"work_id":"292271c5-a3be-4bb5-aedb-7132040782ae","year":2018},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.883909Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:63cbcb93ed101c2c93ff2a5ed83b572a00d5e3c5a76dec7d500370e895b1aa21","observation_id":"899c9652-4ce1-4421-91cf-c81dd3cd9781","resolution":{"observed_at":"2026-08-07T00:57:33.344951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.328969Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"15cd5378-a91d-4da2-8b32-1b378f9cef33","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.887516Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:b6bd8471b1091e61a0ff2e53fdd1dfa66a7fa3989ecb4377f75a55144f34585b","observation_id":"9903387d-0a07-4e20-8ae6-13c96a2f4168","resolution":{"observed_at":"2026-08-07T00:57:33.332584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.316091Z","title":"AWS to offer nvidia’s t4 GPUs for AI inferencing, 2019","venue":null,"work_id":"4740629f-787e-472b-a677-8788e89633b3","year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.891089Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:e1bcfdc8bf8862d6a688b403a2d222302dd3c140d3af88a052c738d1c110364d","observation_id":"a53ad049-1517-4573-a92b-deb66a80e2bb","resolution":{"observed_at":"2026-08-07T00:57:33.320398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.303578Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"b8686215-3ad2-4fec-998e-07fbad682600","year":2021},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.894473Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:8714b333274133545984fbf1a3e93261889f3bc48a923609c31a0d5b1d4ba1c3","observation_id":"a1b134cd-08ca-4b04-9b4a-9d45491791e4","resolution":{"observed_at":"2026-08-07T00:57:33.307403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.291146Z","title":"Accelerating distributed MoE training and inference with lina","venue":null,"work_id":"aab36ea6-bd4f-4389-9001-fb719bcb1bd3","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.898045Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:411e6e9793c3dd89cfd782c59f132d67b1c62a182262fa7c3acd5f607ec2ca47","observation_id":"b49519fd-b6e4-4747-858f-eba378d20bbd","resolution":{"observed_at":"2026-08-07T00:57:33.295114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T00:57:32.902330Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.902330Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:d4da2f4feed30ef6fd381d400ff1c135550bf8e72d165db2bdb8082d11e5e782","observation_id":"d509d5f2-c70d-49d2-b1aa-6b4a4438f67b","resolution":{"observed_at":"2026-08-07T00:57:32.902330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.905968Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.905968Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:a8355833e1549718e7b02f87c8f22ca82a7f34c6e5af336f399eeb174eb6394f","observation_id":"434cd7b8-ca7e-4e57-98d7-209d76973cb4","resolution":{"observed_at":"2026-08-07T00:57:32.905968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.269640Z","title":"Deepspeed-mii: Mii makes low-latency and high-throughput inference possible, powered by deepspeed","venue":null,"work_id":"8bdabc22-73fc-4404-963a-050453dc5e37","year":null},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.909635Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:337b49f6d165ced2b3d8cb9aefaef4ada615fab48edc033b4fdd08cca5408102","observation_id":"ee18e1d9-862c-4881-b67c-c18d9894008d","resolution":{"observed_at":"2026-08-07T00:57:33.273719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:32.917296Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.917296Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:4a84bf0c5de9064e4cb2b7db1b8adc4d595323c133a617de930965d9ac2c755b","observation_id":"95b2e0a3-21d7-4511-9f68-f2f545fc8063","resolution":{"observed_at":"2026-08-07T00:57:32.917296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.235980Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"f016fb05-24cd-4441-908d-a39ddc845eaf","year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.920856Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:0269912bb0ed8ab71df2d7d576361ff7091bb2566644cfc9667d1c09bb4035ad","observation_id":"3195126a-8790-45de-982a-aefa27955565","resolution":{"observed_at":"2026-08-07T00:57:33.239815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.223811Z","title":"DeepSpeed-MoE: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":"3f8bc12a-ccee-486b-b8eb-cd9515717028","year":2022},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.924343Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:efb41c0c58fbcc4b61fe5466f8549ff6d21ecc7cb22d789aa9f56a99e31342bb","observation_id":"797a5ad8-591e-4927-a66e-8fffdc192611","resolution":{"observed_at":"2026-08-07T00:57:33.227715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.210882Z","title":"Outrageously large neural networks: The sparsely- gated mixture-of-experts layer","venue":null,"work_id":"c411ad96-7224-4fd9-ad39-c3956754e24f","year":2017},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.927724Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:d8a01d3ea2d929e50c27da177339978be31113061b6a0fe770bb4cfdfd638b27","observation_id":"aef745bd-b596-4ae7-a9ee-7af36f6fdcb7","resolution":{"observed_at":"2026-08-07T00:57:33.215236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.198680Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":"45ee78e4-a987-46ac-b5b1-f47042b71e0d","year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.931223Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:0ce8fa3c8f45bc7fb265ecf72a1e0ba16cd04166a36223e2c6aaebcab7fdb48a","observation_id":"461ce789-0910-464d-b777-7519b71a159c","resolution":{"observed_at":"2026-08-07T00:57:33.202658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.186642Z","title":"Borg: the next generation","venue":null,"work_id":"e7c60222-cc70-4d3a-8b38-8922569029f7","year":2020},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.934674Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:8c10b89fbe3b7f21ff5a4c941e8b97f9dab90d80be9d6cb30d3a72f6e4b383d6","observation_id":"a1711014-cffb-4582-8751-962448885974","resolution":{"observed_at":"2026-08-07T00:57:33.190565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.173566Z","title":"Attention is all you need","venue":null,"work_id":"6ed391dc-bd49-4d3e-809d-3b5b7540a74e","year":2017},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.938064Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:4e28d038d6e78f9e121a035a21e98739772de6111c1868e979444516fd8de73e","observation_id":"e3d7be92-1c27-4073-bfd5-2ddf0befb776","resolution":{"observed_at":"2026-08-07T00:57:33.177817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.160194Z","title":"Prophet: Fine-grained load balancing for parallel training of large-scale moe models","venue":null,"work_id":"0a02c384-fd48-4632-bc7b-a6ee92488617","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.941528Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:54f3de9ce32cff72c9f219006eb93b7c2b96ffc3501c4cc086805c4e2a131128","observation_id":"b515975f-470e-4213-941d-a8e93a5a0525","resolution":{"observed_at":"2026-08-07T00:57:33.164132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.147532Z","title":"Resource-efficient algorithms and systems of foundation models: A survey","venue":null,"work_id":"83ef396d-dd5b-4dd1-a65b-b2683370f8fa","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.945320Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:4ec043391375fc5222b0e34f464e2b802252523f5122771e295487e5142bec99","observation_id":"09193130-6c13-4302-a06f-cbb3dbe6ed3c","resolution":{"observed_at":"2026-08-07T00:57:33.151534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:57:32.948934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.948934Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:d8dec39776008124b9262f7716dea94fbe9611cee4e2840da04ef45e980bac58","observation_id":"70c8a7b8-7217-4b16-a8ca-4bee9cf1fc76","resolution":{"observed_at":"2026-08-07T00:57:32.948934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.135032Z","title":"Harnessing the power of LLMs in practice: A survey on chatgpt and beyond","venue":null,"work_id":"c00d903f-b87b-413a-8e71-542873810261","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.952538Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:ee849311068516bc38b295f1e7589ee1978be0e6608a9946e5768e62a4fb5726","observation_id":"f13c2bcf-08ac-4428-969e-df9c5f0bc56f","resolution":{"observed_at":"2026-08-07T00:57:33.139056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.122284Z","title":"Exploiting inter-layer expert affinity for accelerating mixture-of- experts model inference","venue":null,"work_id":"c94fbf55-0966-4b18-9c4e-3af615066f3d","year":2024},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.956355Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:7d46deab68a9c08f006f99b6aac3547ea96bae063f008a86eb6440a1a6e35d3c","observation_id":"33d07119-e7e6-4e3f-a417-77c4e826e6de","resolution":{"observed_at":"2026-08-07T00:57:33.126477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.109840Z","title":"SmartMoE: Efficiently training Sparsely-Activated models through combining offline and online parallelization","venue":null,"work_id":"02944f73-3bfb-4469-8c76-7719fe8fb032","year":2023},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.959823Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:3bee46607e44b4e4ab0e20e5f0fb5659476dc937861698a8c4fcca14c6781f1a","observation_id":"25f8865e-cbd2-42ad-909a-9a5eeac9efb0","resolution":{"observed_at":"2026-08-07T00:57:33.113747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.06724","last_updated":"2015-06-22T19:26:56Z","snapshot_observed_at":"2026-08-06T16:37:38.107677Z","submitted_at":"2015-06-22T19:26:56Z","title":"Aligning Books and Movies: Towards Story-like Visual Explanations by Watching Movies and Reading Books","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.06724","snapshot_observed_at":"2026-08-07T00:57:32.963734Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.963734Z"},"links":{"cited_paper":"/paper/1506.06724","citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:10e9c6f53dca44f554c667fee3857054ab63e013cf80583d766ff248dcc2e339","observation_id":"c367ef27-b1e2-4b77-9f1f-ef08e899122a","resolution":{"observed_at":"2026-08-07T00:57:32.963734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:57:33.257095Z","title":null,"venue":null,"work_id":"90286696-f6b0-48bb-91f2-dd996c110049","year":2025},"citing_paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:32.913583Z"},"links":{"citing_paper":"/paper/2506.12417"},"observation_digest":"sha256:27c8f98f047d76e4081377fb009dde6f4bcf6dc049d276896c09d07a3662079b","observation_id":"32e082bc-2146-42df-8ca6-c3ee6fb2de9b","resolution":{"observed_at":"2026-08-07T00:57:33.261045Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12417","last_updated":"2025-06-17T08:25:12Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-10T06:33:54.300406Z","submitted_at":"2025-06-14T09:21:52Z","title":"HarMoEny: Efficient Multi-GPU Inference of MoE Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":11,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.12417."}