{"as_of":"2026-08-12T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e8354049745c4702b5e501cc3537f622292edbfbb0ac6420a32c571bff4f427","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:52.247745Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22919/citation-record","integrity":"/paper/2506.22919/integrity","json":"/paper/2506.22919/citation-record.json","paper":"/paper/2506.22919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:55.430257Z","title":"Le, and Geoffrey Hinton","venue":null,"work_id":"c95c5268-459c-40c0-9a7b-17ad90396c0d","year":2017},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.496787Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:0e33baf4c0b0c44fdef4ea55e5c55986c914c786b2bffbd7b37d503bb7a08770","observation_id":"60bdd10f-92ae-471f-a03a-a76dbbab877d","resolution":{"observed_at":"2026-08-06T21:59:55.630496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:49.606183Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.606183Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:ddbb087120ef3451a0b81c9876ac4b07a61be27fd5010d63316be91051a39817","observation_id":"309b2c77-a360-4830-851b-86e9fbb54a21","resolution":{"observed_at":"2026-08-06T21:59:49.606183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-06T21:59:49.709718Z","title":"Gshard: Scaling giant models with conditional com- putation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.709718Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:6c906e3709726d277867e566ca6c9f01765262e7e3ca91a32ef38ddc788ba1d0","observation_id":"0d8f1028-5cec-417d-bc00-149ebfb90d3e","resolution":{"observed_at":"2026-08-06T21:59:49.709718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-12T06:03:03.703202Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-06T21:59:49.832400Z","title":"Deepseekmoe: Towards efficient mixture-of-experts with generalist routing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.832400Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:636040e3ba45bc742c9192143e5d31f8c5045de15ba93796cd789a333d1ab302","observation_id":"d8dbf301-52b4-4a64-825b-30a86a5fd31d","resolution":{"observed_at":"2026-08-06T21:59:49.832400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13491","last_updated":"2022-11-24T09:31:02Z","snapshot_observed_at":"2026-08-11T08:10:46.383452Z","submitted_at":"2022-11-24T09:31:02Z","title":"Spatial Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2211.13491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.13491","snapshot_observed_at":"2026-08-06T21:59:53.072109Z","title":"Spatial Mixture-of-Experts","venue":"cs.LG","work_id":"d8d4c63a-536e-4bcf-93ef-3182f387d8bc","year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:49.913942Z"},"links":{"cited_paper":"/paper/2211.13491","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:427c4cb4cbabb0fcf1ad21a3802abe4c76cab5a1e2aae234c7c2485f7948ce19","observation_id":"1b363b70-7006-47b6-831d-004f74b004b4","resolution":{"observed_at":"2026-08-06T21:59:53.127458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09368","last_updated":"2022-10-14T00:08:24Z","snapshot_observed_at":"2026-08-12T04:05:36.902140Z","submitted_at":"2022-02-18T17:46:11Z","title":"Mixture-of-Experts with Expert Choice Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.09368","snapshot_observed_at":"2026-08-06T21:59:50.065384Z","title":"Mixture-of-experts with expert choice routing.arXiv preprint arXiv:2202.09368, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.065384Z"},"links":{"cited_paper":"/paper/2202.09368","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:b97895b26aaf4fcc425472a5c1a6e133f89ffdb2430d6502415bbc5871461029","observation_id":"be5941ef-23e5-4c87-a329-368af8cb73fe","resolution":{"observed_at":"2026-08-06T21:59:50.065384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12066","last_updated":"2024-04-27T09:11:44Z","snapshot_observed_at":"2026-08-10T10:55:31.192385Z","submitted_at":"2023-08-23T11:25:37Z","title":"Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference","version":3},"cited_work":{"arxiv_id":"2308.12066","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.12066","snapshot_observed_at":"2026-08-06T21:59:52.903235Z","title":"Pre-gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference","venue":"cs.LG","work_id":"94858427-fa88-407a-88db-d34f2691d204","year":2023},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.163344Z"},"links":{"cited_paper":"/paper/2308.12066","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:d25bb765862c8f039305aa07dae36195533721f3a464ac73f2b99ba6892f2c70","observation_id":"e256eb57-97a2-4c87-8379-42a0163b7606","resolution":{"observed_at":"2026-08-06T21:59:52.966451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:50.227752Z","title":"Spectra: Specialized experts from prompt tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.227752Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:43ea26a3b9d5c844e7105f805ec1cf1b2659d58ae34ebdcf05db85f74321d407","observation_id":"ba70103b-0b5a-4fe0-bf73-ccdcf82fb49b","resolution":{"observed_at":"2026-08-06T21:59:50.227752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06491","last_updated":"2025-03-09T07:24:36Z","snapshot_observed_at":"2026-08-07T17:19:20.639630Z","submitted_at":"2025-03-09T07:24:36Z","title":"MoFE: Mixture of Frozen Experts Architecture","version":1},"cited_work":{"arxiv_id":"2503.06491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06491","snapshot_observed_at":"2026-08-06T21:59:52.698537Z","title":"MoFE: Mixture of Frozen Experts Architecture","venue":"cs.CL","work_id":"dec3fcfe-19bf-4a80-a811-a42a82dc8e84","year":2025},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.311502Z"},"links":{"cited_paper":"/paper/2503.06491","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:323f6897cc01ee4cdde64577d931b6b12e8bd9cfa45f4905c408b7155ef5ad97","observation_id":"3469579c-4014-4539-b71a-7695b16064fb","resolution":{"observed_at":"2026-08-06T21:59:52.757826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04640","last_updated":"2023-09-11T19:31:26Z","snapshot_observed_at":"2026-08-05T03:29:35.055063Z","submitted_at":"2023-06-07T17:59:57Z","title":"ModuleFormer: Modularity Emerges from Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04640","snapshot_observed_at":"2026-08-06T21:59:50.455762Z","title":"Moduleformer: Modu- larization of pretrained transformers with self- supervised mixture-of-experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.455762Z"},"links":{"cited_paper":"/paper/2306.04640","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:7d6152bc1bb64fc243caa2b49a97999d2f2294db6a9c3fdc88ba2299d788d86d","observation_id":"c59ac4f5-1fb6-458c-b1c8-f48982e6a70f","resolution":{"observed_at":"2026-08-06T21:59:50.455762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07535","last_updated":"2023-06-07T22:41:40Z","snapshot_observed_at":"2026-07-06T14:05:06.502938Z","submitted_at":"2022-10-14T05:32:17Z","title":"AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for Efficient Neural Machine Translation","version":2},"cited_work":{"arxiv_id":"2210.07535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07535","snapshot_observed_at":"2026-08-06T21:59:52.566478Z","title":"AutoMoE: Heterogeneous Mixture-of-Experts with Adaptive Computation for Efficient Neural Machine Translation","venue":"cs.CL","work_id":"dbf1b9a0-6b7f-492c-b95e-8ab595facd9f","year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.614447Z"},"links":{"cited_paper":"/paper/2210.07535","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:e2a0989e6ce8ce5766b761e630ef31b2f4a1af5dd14fad7e98a0c8e49636e2f4","observation_id":"a7f9b936-c339-4e02-8aaf-9e9055d6dcb1","resolution":{"observed_at":"2026-08-06T21:59:52.602236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14685","last_updated":"2022-11-17T11:30:17Z","snapshot_observed_at":"2026-08-10T12:49:30.614724Z","submitted_at":"2022-03-28T12:32:25Z","title":"HetuMoE: An Efficient Trillion-scale Mixture-of-Expert Distributed Training System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14685","snapshot_observed_at":"2026-08-06T21:59:50.741606Z","title":"Hetumoe: Towards training and serving heterogeneous moe models efficiently","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.741606Z"},"links":{"cited_paper":"/paper/2203.14685","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:0bbc420def09cc44dee946b66c89a1475a4bfdeabd64725e9e87322b3dcbad13","observation_id":"cc7bfa8b-6dc4-47de-9f03-c8c844c7093f","resolution":{"observed_at":"2026-08-06T21:59:50.741606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05313","last_updated":"2025-01-09T15:29:33Z","snapshot_observed_at":"2026-08-12T03:56:33.318160Z","submitted_at":"2025-01-09T15:29:33Z","title":"Optimizing Distributed Deployment of Mixture-of-Experts Model Inference in Serverless Computing","version":1},"cited_work":{"arxiv_id":"2501.05313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05313","snapshot_observed_at":"2026-08-06T21:59:52.416593Z","title":"Optimizing Distributed Deployment of Mixture-of-Experts Model Inference in Serverless Computing","venue":"cs.DC","work_id":"f806ac6b-f76d-421e-b417-e9c6fb56dcbc","year":2025},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.912662Z"},"links":{"cited_paper":"/paper/2501.05313","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:d9f047c092eb0044bc208c472f885a3c876992e16d9493daed6b8ddff36fd451","observation_id":"a55f8727-180e-46d9-b188-4c0d8ee21fee","resolution":{"observed_at":"2026-08-06T21:59:52.473973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08982","last_updated":"2026-05-18T20:44:06Z","snapshot_observed_at":"2026-07-06T19:50:01.724540Z","submitted_at":"2024-11-13T19:18:08Z","title":"Lynx: Enabling Efficient MoE Inference through Dynamic Batch-Aware Expert Selection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08982","snapshot_observed_at":"2026-08-06T21:59:50.990181Z","title":"Modular prompting via expert aggregation.arXiv preprint arXiv:2411.08982, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:50.990181Z"},"links":{"cited_paper":"/paper/2411.08982","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:577c8cf9bfce6a0dff25c4b43dd20dc3daffebd45aac7f91ad4543d9422fb836","observation_id":"ffc2873b-1fa5-4fc2-b41e-70f1660cc949","resolution":{"observed_at":"2026-08-06T21:59:50.990181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07639","last_updated":"2025-03-05T17:40:54Z","snapshot_observed_at":"2026-08-07T17:26:56.743529Z","submitted_at":"2025-03-05T17:40:54Z","title":"Mixture of Experts Made Intrinsically Interpretable","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07639","snapshot_observed_at":"2026-08-06T21:59:51.114219Z","title":"Moe-x: Mixture of ex- perts made intrinsically interpretable.arXiv preprint arXiv:2503.07639, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.114219Z"},"links":{"cited_paper":"/paper/2503.07639","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:dda7c180ffb848d7d69a242728fd73e06eeb5be012c40e8fdb4a79bb4f943cbb","observation_id":"2daa65f7-25ab-441c-8a07-84edde042d01","resolution":{"observed_at":"2026-08-06T21:59:51.114219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-08-10T10:53:30.608519Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-06T21:59:51.170050Z","title":"Deepspeed-moe: Advanc- ing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.170050Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:15f505ecd358407d97fb2b290c9b44114a2ebd217ad3d50ec13b605648c34909","observation_id":"e60790ab-ee19-4e09-a1ef-42a9d02db857","resolution":{"observed_at":"2026-08-06T21:59:51.170050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08744","last_updated":"2025-03-23T17:26:23Z","snapshot_observed_at":"2026-08-07T16:43:01.273598Z","submitted_at":"2025-03-23T17:26:23Z","title":"ExpertRAG: Efficient RAG with Mixture of Experts -- Optimizing Context Retrieval for Adaptive LLM Responses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08744","snapshot_observed_at":"2026-08-06T21:59:51.219171Z","title":"Expertrag: Augmenting large language models with specialized experts for retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.219171Z"},"links":{"cited_paper":"/paper/2504.08744","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:54faa6293511943677c448c54c0f28f7bad48ae31a4d637ceb97fdf0ac096394","observation_id":"044cc1e5-d93a-40d2-ac74-686209d5134c","resolution":{"observed_at":"2026-08-06T21:59:51.219171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01359","last_updated":"2025-03-03T09:52:46Z","snapshot_observed_at":"2026-08-07T17:34:14.706978Z","submitted_at":"2025-03-03T09:52:46Z","title":"DeRS: Towards Extremely Efficient Upcycled Mixture-of-Experts Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01359","snapshot_observed_at":"2026-08-06T21:59:51.254870Z","title":"Ders: Decoding with expert routing and selec- tion for mixture-of-experts models.arXiv preprint arXiv:2503.01359, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.254870Z"},"links":{"cited_paper":"/paper/2503.01359","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:edc0945d834f2521f5896bd99197e4800ab3941d48d3ac48a368f8e23319916c","observation_id":"0b6b33a2-3f54-4fbd-9438-dc22301a1ed2","resolution":{"observed_at":"2026-08-06T21:59:51.254870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:55.140560Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":"6d8a09e6-310a-4334-b912-ce8f990663d9","year":2013},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.299119Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:4feb75af05840bb54d31e25d3499788f632efa081dd11b59904b71063de32a3e","observation_id":"62c484b2-9f77-49b7-83df-7e7153903605","resolution":{"observed_at":"2026-08-06T21:59:55.249289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04308","last_updated":"2025-04-06T00:37:36Z","snapshot_observed_at":"2026-08-07T16:08:18.617168Z","submitted_at":"2025-04-06T00:37:36Z","title":"Gating is Weighting: Understanding Gated Linear Attention through In-context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04308","snapshot_observed_at":"2026-08-06T21:59:51.366299Z","title":"Gating is weighting: Understanding gated linear attention through in-context learning.arXiv preprint arXiv:2504.04308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.366299Z"},"links":{"cited_paper":"/paper/2504.04308","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:d6a0a47858f9eed0ae23b4a22d744f5bd5f40ead631321a8cd77e02b092c1c2c","observation_id":"41bfd936-739a-4324-88b6-1a8545c93b0e","resolution":{"observed_at":"2026-08-06T21:59:51.366299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10034","last_updated":"2024-08-12T09:23:13Z","snapshot_observed_at":"2026-08-03T20:04:29.832038Z","submitted_at":"2022-05-20T09:09:27Z","title":"MoESys: A Distributed and Efficient Mixture-of-Experts Training and Inference System for Internet Services","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10034","snapshot_observed_at":"2026-08-06T21:59:51.427121Z","title":"Moesys: A distributed and efficient mixture-of- experts training and inference system for internet services","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.427121Z"},"links":{"cited_paper":"/paper/2205.10034","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:f287dd895020f45fa3d75f760fd1a091c1341c5b701cef55145c6f3737d12bf9","observation_id":"bba7f7c2-dd04-4b92-8ba4-29e4791a7706","resolution":{"observed_at":"2026-08-06T21:59:51.427121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11144","last_updated":"2025-03-14T07:22:07Z","snapshot_observed_at":"2026-08-07T17:04:48.503303Z","submitted_at":"2025-03-14T07:22:07Z","title":"MoLEx: Mixture of Layer Experts for Finetuning with Sparse Upcycling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11144","snapshot_observed_at":"2026-08-06T21:59:51.527234Z","title":"Molex: Modular and lightweight experts for efficient fine- tuning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.527234Z"},"links":{"cited_paper":"/paper/2503.11144","citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:bc2de23d4b183dceca1df399ef4d482c600b38feab32dd5f42363c5d8a9a4a51","observation_id":"467ffaca-465b-4b9d-b1a1-7dc41a937277","resolution":{"observed_at":"2026-08-06T21:59:51.527234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:54.887834Z","title":"Two-expert routing adds a modest +0.58pp over Top–1, still below the GRU+GRU upper- bound (90.62%)","venue":null,"work_id":"f585c190-7f96-4f13-8a68-f53962138f21","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.607108Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:5f0925eddd3431cf15d736b50c742c1dfc68a13a0db15b5246d54973b78468a3","observation_id":"be2399fe-57d2-4b30-ab5a-3fab6c346652","resolution":{"observed_at":"2026-08-06T21:59:55.019473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:54.485251Z","title":"Entropy plummets from 0.65 to 0.15 bits, indicating almost deterministic gating","venue":null,"work_id":"3d605632-d2e2-4949-9a72-617eee5e1780","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.691078Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:a449f39de5af13d94469c997eb06f2681241601d4f229cfb7d9885f7720f383c","observation_id":"cf6e564b-14f0-49cb-957e-9aaf43c8ee4b","resolution":{"observed_at":"2026-08-06T21:59:54.651214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:54.049485Z","title":"always run the GRU","venue":null,"work_id":"671ee244-71eb-4448-be3f-be5a7409e154","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.774537Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:cedffb5439ca2b5da9b3ccd3bbba1d26cdb7ffb210716be7d3afea146306fff8","observation_id":"1ca250bc-f7a4-4ddf-bdd2-16dbebc8a751","resolution":{"observed_at":"2026-08-06T21:59:54.272552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.891729Z","title":"Because two experts fire per sample, single-expert attribution is lost - diluting the inter- pretability benefit of sparse MoEs","venue":null,"work_id":"7f524aba-abf8-47ef-a0a3-256fdf7defdc","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.841232Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:7920fae25f5f84f2253ae4b8b1f81942b0ed238d63a65cd0697a56a5f2059f7a","observation_id":"7ea3c8ce-77c0-445d-bd01-b461f07fa6db","resolution":{"observed_at":"2026-08-06T21:59:53.922369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.845444Z","title":"Executing both lightweight heads adds < 0.1 ms on a T4 GPU; compute cost is negligible","venue":null,"work_id":"18ba3cf6-71d5-4d09-b222-7bd92972cacd","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.904877Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:e10c7000cb95f44f232c4ca09ef8e9ee23161ea016eb69eb5c3867715df2eea9","observation_id":"bdb4b1ab-253d-43b1-ad49-de25eab26a27","resolution":{"observed_at":"2026-08-06T21:59:53.882957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.690137Z","title":"Removing both losses scarcely changes accuracy (+0.13pp difference)","venue":null,"work_id":"83088ec3-45f3-4ec4-bf8c-c47be41ad5fd","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:51.963610Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:da2f2031ca4fc095727443dd7058f8c86745db8eee1227d335874baf3bd390d1","observation_id":"ba82faa4-c5a1-4229-9187-39e6a55a3b6b","resolution":{"observed_at":"2026-08-06T21:59:53.761905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.575091Z","title":"Entropy collapses from 0.40 bits to 0.02 bits—the gate becomes almost deterministic","venue":null,"work_id":"5b3f19b0-5789-4bb4-9b23-7d2278f67a8e","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.043860Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:cd54e1ee86c32e54b773eba1c54633b1ff31dee5a67517765aaab998f4684d79","observation_id":"1879f162-15cd-469b-9782-76d4f4cce305","resolution":{"observed_at":"2026-08-06T21:59:53.627356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.461534Z","title":"Without losses, the FFNN path receives 99.7% of inputs; the GRU is effectively bypassed","venue":null,"work_id":"57b39564-faaa-43c0-b1cd-02137d59e250","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.121778Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:e735a865f89075973882df79290e63effce5c8c6e31c472d0eb2008ca6d6289e","observation_id":"efefa1ed-897c-4a86-8353-bf476bb6d453","resolution":{"observed_at":"2026-08-06T21:59:53.514368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.344353Z","title":"Regularisation preserves a bal- anced and interpretable routing pattern, while the un-regularised variant hides all computation in one expert","venue":null,"work_id":"aa7e49e6-e13e-4931-87d5-bee2ddc27f94","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.181090Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:5f49014bcb0f365b9485bd20a440e06ce91c2322a2736dfb8528cd067f42e5c2","observation_id":"f1e995ce-7be8-48a0-a5dd-591956d02d6a","resolution":{"observed_at":"2026-08-06T21:59:53.398974Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:59:53.214639Z","title":null,"venue":null,"work_id":"f2383507-7057-4076-a61b-92efda300f19","year":null},"citing_paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:52.247745Z"},"links":{"citing_paper":"/paper/2506.22919"},"observation_digest":"sha256:f3e956d871ab578eb696f0e4366f600b5c95e1f147c7e366c44707923d0e50ae","observation_id":"4415ca7f-80a4-49bf-a6e6-f7ea3a0cccc8","resolution":{"observed_at":"2026-08-06T21:59:53.261853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22919","last_updated":"2025-07-01T09:00:34Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T10:54:07.737756Z","submitted_at":"2025-06-28T15:03:43Z","title":"Hecto: Modular Sparse Experts for Adaptive and Interpretable Reasoning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":10},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2506.22919."}