{"as_of":"2026-08-14T23:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:169226cd04db9896304dffb484d83d25800b3b75b6a4c85777991265db1e44fa","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:49:17.483517Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:55:02.197434Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-09T12:08:23.021613Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04139","snapshot_observed_at":"2026-08-10T14:55:02.197434Z","title":"Monet: Mixture of monosemantic experts for transformers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14926","last_updated":"2025-02-07T19:22:32Z","snapshot_observed_at":"2026-08-14T20:11:56.886595Z","submitted_at":"2025-01-24T21:31:12Z","title":"Interpretability in Parameter Space: Minimizing Mechanistic Description Length with Attribution-based Parameter Decomposition","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T14:55:02.197434Z"},"links":{"cited_paper":"/paper/2412.04139","citing_paper":"/paper/2501.14926"},"observation_digest":"sha256:627ab4c1f888703d4a5738020895db06008f6afb06c050de6ca14451f952875b","observation_id":"e3e18910-6f01-4337-ad66-3b0d06010f01","resolution":{"observed_at":"2026-08-10T14:55:02.197434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"cited_work":{"arxiv_id":"2412.04139","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04139","snapshot_observed_at":"2026-08-09T12:08:23.021613Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","venue":"cs.AI","work_id":"66239944-f0be-4646-9038-cc3285dd105e","year":2024},"citing_paper":{"arxiv_id":"2502.02470","last_updated":"2025-07-25T10:41:54Z","snapshot_observed_at":"2026-08-10T06:26:34.580026Z","submitted_at":"2025-02-04T16:44:38Z","title":"Studying Cross-cluster Modularity in Neural Networks","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T12:08:22.805965Z"},"links":{"cited_paper":"/paper/2412.04139","citing_paper":"/paper/2502.02470"},"observation_digest":"sha256:52a1b829288376e4586b4120f0f5153f5cebe71f6f27d4847a8105214babb370","observation_id":"a9802ffa-0cfa-4a99-b7e6-efa79ea705d1","resolution":{"observed_at":"2026-08-09T12:08:23.058043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04139/citation-record","integrity":"/paper/2412.04139/integrity","json":"/paper/2412.04139/citation-record.json","paper":"/paper/2412.04139"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-12T23:40:54.718397Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-11T21:49:17.305101Z","title":"Nemotron-4 340B Technical Report.arXiv preprint arXiv:2406.11704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.305101Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:1080aa68cca048b727b6fea0be04eadb513e512c6f788f44802a2e9a3b761e7e","observation_id":"48ae1320-e6a8-437e-ac3a-4fed29d17f1b","resolution":{"observed_at":"2026-08-11T21:49:17.305101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.011318Z","title":"b\", nn.initializers.zeros, b_shape) 11 12def __call__(self, x, g1, g2): 13x = nn.relu(self.u(x)) ** 2 14x = jnp.einsum(","venue":null,"work_id":"16f08a5d-fb95-49cd-bee8-d2634154f838","year":2019},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.440051Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:9bee65b9bee2f845e5464858862aa8a7e9d434a2462bec603898fce78a4d3618","observation_id":"0b05858b-9258-499a-bb95-2cdf3134d911","resolution":{"observed_at":"2026-08-11T21:49:18.015573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.319506Z","title":"Haozhe Chen, Carl V ondrick, and Chengzhi Mao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.319506Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:ba3e6014cf4d946461ec4395e860c2f46dbed3ef8a8113daf0837a8ea5544833","observation_id":"f52d3f37-a5a4-4a4a-976d-58e3e238cf44","resolution":{"observed_at":"2026-08-11T21:49:17.319506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.900822Z","title":"F**kyou!F**k (...)* (16.68%)(...)Snakesonamotherf*ckingplane","venue":null,"work_id":"edfa2ff9-89ef-499e-b87e-b388a1a0b0a7","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.476617Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:d2f827cad8e52b012f49f1a00e65c49bd007e9486044a0d471a01154296515e1","observation_id":"c3bd332f-a45c-490c-81c8-a25fd29239de","resolution":{"observed_at":"2026-08-11T21:49:17.904732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.099555Z","title":"RealToxi- cityPrompts: Evaluating Neural Toxic Degeneration in Language Models","venue":null,"work_id":"339789ad-c035-41ef-8cb8-79a36c8d8c18","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.332827Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:df9c8125ab20b4da488189481f32d7c853fce32a29e1b5aa2557e3583d9e3c85","observation_id":"cb4d296f-f8ed-4751-80d6-5f80c23a81c6","resolution":{"observed_at":"2026-08-11T21:49:18.103123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.088432Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","venue":null,"work_id":"cb350d95-35fe-4892-86ed-5c86abee82a8","year":2021},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.337104Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:c635047ce38519c25588f64f892cd62aead6d6a7cf0058cada3bf7b654856768","observation_id":"50b5e7a9-de52-495d-b6ee-ae6976f0760c","resolution":{"observed_at":"2026-08-11T21:49:18.092077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-12T23:28:33.412949Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-11T21:49:17.345568Z","title":"Mixture of a million experts.arXiv preprint arXiv:2407.04153,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.345568Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:b28ee60301f9e68815a46f25bcdd5180d2409faabd3d25e9ded4c000c7552cad","observation_id":"079ff9d5-2989-4396-b146-5c1b7bf9854e","resolution":{"observed_at":"2026-08-11T21:49:17.345568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12001","last_updated":"2023-10-09T22:57:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-21T03:35:06Z","title":"An Overview of Catastrophic AI Risks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12001","snapshot_observed_at":"2026-08-11T21:49:17.350721Z","title":"An Overview of Catastrophic AI Risks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.350721Z"},"links":{"cited_paper":"/paper/2306.12001","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:4d1f39f5ce4fddb66b19a5ffe15ee8253cc4e0cc37df228a839f33d6c6e62863","observation_id":"7be31826-7cc4-468c-832e-0eaaf53d73fc","resolution":{"observed_at":"2026-08-11T21:49:17.350721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-11T21:49:17.355345Z","title":"AI Alignment: A Comprehensive Survey.arXiv preprint arXiv:2310.19852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.355345Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:1a1d32e5f30bfad8a0e2e1284d10e1bd03d756124e5561b02904c4aca7a75779","observation_id":"282fbb42-89ca-4431-92a4-f850a48bdc8d","resolution":{"observed_at":"2026-08-11T21:49:17.355345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-11T21:49:17.359959Z","title":"Mixtral of Experts.arXiv preprint arXiv:2401.04088,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.359959Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:6a4203991be96e8572d0d920a2b640f2f7e8829e2cdeb6860d91db269931f751","observation_id":"a8d396f3-f03a-4a46-8b79-f4fe4f2aae47","resolution":{"observed_at":"2026-08-11T21:49:17.359959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15533","last_updated":"2022-11-20T18:15:30Z","snapshot_observed_at":"2026-08-13T13:38:46.469939Z","submitted_at":"2022-11-20T18:15:30Z","title":"The Stack: 3 TB of permissively licensed source code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15533","snapshot_observed_at":"2026-08-11T21:49:17.366448Z","title":"Denis Kocetkov, Raymond Li, Loubna Ben Allal, Jia Li, Chenghao Mou, Carlos Mu ˜noz Ferran- dis, Yacine Jernite, Margaret Mitchell, Sean Hughes, Thomas Wolf, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.366448Z"},"links":{"cited_paper":"/paper/2211.15533","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:47936febd76ba348545edec6bb2f637c93473b50c557e3f59159c766e0eae2b5","observation_id":"5837cd5c-81c5-4297-9768-8331a34d6c41","resolution":{"observed_at":"2026-08-11T21:49:17.366448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16437","last_updated":"2025-02-19T14:35:07Z","snapshot_observed_at":"2026-08-12T23:36:21.529832Z","submitted_at":"2024-06-24T08:29:58Z","title":"Theory on Mixture-of-Experts in Continual Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16437","snapshot_observed_at":"2026-08-11T21:49:17.372648Z","title":"Theory on Mixture-of- Experts in Continual Learning.arXiv preprint arXiv:2406.16437,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.372648Z"},"links":{"cited_paper":"/paper/2406.16437","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:beec0bf46716bb75a315803c7f0393032b2880ffc89320b4c3d0a8b11948979e","observation_id":"c909ed0d-cae8-4be6-a2ea-195e35dfac81","resolution":{"observed_at":"2026-08-11T21:49:17.372648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-11T21:49:17.377588Z","title":"StarCoder: may the source be with you!arXiv preprint arXiv:2305.06161,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.377588Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:ad8046ce03c1a8ab7eb5ec3c6b286c67fe2329fc75de62566d6f13e6902cccef","observation_id":"09b0c3ed-ca01-4bd2-b729-05e8f79176b7","resolution":{"observed_at":"2026-08-11T21:49:17.377588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.076426Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","venue":null,"work_id":"cf4fb66f-4f64-4c3d-85ef-92581a27076b","year":2024},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.381840Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:72c10530a8f31883253292316d1eb8e9993796059cc6e0aad65537837c276c97","observation_id":"a5f7b35d-b5d2-4d89-b75d-2b9c9eed1692","resolution":{"observed_at":"2026-08-11T21:49:18.080870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19647","snapshot_observed_at":"2026-08-11T21:49:17.386441Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Mod- els.arXiv preprint arXiv:2403.19647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.386441Z"},"links":{"cited_paper":"/paper/2403.19647","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:6da5864fb5c0417e7f6f3d349691f2698c3ae875598cb542eca6c8f0ed5ad505","observation_id":"27bd9235-fb72-459e-ac69-e41d5c8db21b","resolution":{"observed_at":"2026-08-11T21:49:17.386441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.062471Z","title":"Jesse Mu and Jacob Andreas","venue":null,"work_id":"50376467-7413-4ad1-bbac-03fb5552f669","year":2022},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.392160Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:9e0b4a5269a934c2f7dcac2b67cfb11b14bf3842ab2bdbe3f516e530929d0c6e","observation_id":"ec5e0d1f-8b6d-4135-a950-e7c1c5844321","resolution":{"observed_at":"2026-08-11T21:49:18.066925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-08-12T09:26:45.158981Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-11T21:49:17.396208Z","title":"OLMoE: Open Mixture-of-Experts Language Models.arXiv preprint arXiv:2409.02060,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.396208Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:f9d4ef71627c4ff22e15415f47fe5e1bfc36b74aa42fb6c9e285db57e6c45ea0","observation_id":"e650a4d8-dfe9-47c6-b120-9261da758d87","resolution":{"observed_at":"2026-08-11T21:49:17.396208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05567","last_updated":"2024-04-08T14:39:49Z","snapshot_observed_at":"2026-08-14T08:26:25.861722Z","submitted_at":"2024-04-08T14:39:49Z","title":"Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05567","snapshot_observed_at":"2026-08-11T21:49:17.400132Z","title":"Dense Training, Sparse Inference: Rethinking Training of Mixture-of- Experts Language Models.arXiv preprint arXiv:2404.05567,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.400132Z"},"links":{"cited_paper":"/paper/2404.05567","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:ae60d5ecf4f526d823b0146d1da81b17326ea21f1d029eccaecaeee4285d574e","observation_id":"17cd2fc4-25f7-46dc-b552-0baf645a894d","resolution":{"observed_at":"2026-08-11T21:49:17.400132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-14T14:43:02.130172Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-11T21:49:17.404980Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.arXiv preprint arXiv:2406.17557,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.404980Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:88191f9d018b836bf5c5b854667e446e16fa3f64f9a4329b2c46ef1ff0387b96","observation_id":"aefa3d9c-84a0-4219-83bf-2b3f5d689843","resolution":{"observed_at":"2026-08-11T21:49:17.404980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.049977Z","title":"Taking features out of superposition with sparse autoencoders","venue":null,"work_id":"6f48b61b-b4ce-436f-b0b5-a6cd9d61c960","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.410568Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:a55eabd12d8b5b13ffacb1c2e5962f42819b54fd4d5f0ae5682d7359476dd3b9","observation_id":"fa7fe330-0eaf-4015-bae2-c6511e5a16a9","resolution":{"observed_at":"2026-08-11T21:49:18.053942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07413","last_updated":"2024-04-11T00:52:39Z","snapshot_observed_at":"2026-08-13T00:33:01.973672Z","submitted_at":"2024-04-11T00:52:39Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07413","snapshot_observed_at":"2026-08-11T21:49:17.414775Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars.arXiv preprint arXiv:2404.07413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.414775Z"},"links":{"cited_paper":"/paper/2404.07413","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:b69cf20da0aedceeedb11c4a9c2791728ac9398f3c29e44d545440f42b823471","observation_id":"8cb3b353-fb27-4997-a56f-98bdb79ee9c0","resolution":{"observed_at":"2026-08-11T21:49:17.414775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17230","last_updated":"2023-10-26T08:28:48Z","snapshot_observed_at":"2026-08-13T05:40:04.482565Z","submitted_at":"2023-10-26T08:28:48Z","title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17230","snapshot_observed_at":"2026-08-11T21:49:17.418586Z","title":"Codebook Features: Sparse and Discrete Interpretability for Neural Networks.arXiv preprint arXiv:2310.17230,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.418586Z"},"links":{"cited_paper":"/paper/2310.17230","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:27fc49c52ac6ae401ddbf79dd97b7d3c3764c7a8622299aab049587b3d992ce7","observation_id":"4dc2d541-93b0-4641-9cde-bbe132a9a1b0","resolution":{"observed_at":"2026-08-11T21:49:17.418586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-11T21:49:17.422409Z","title":"Gemma 2: Improving Open Language Models at a Practical Size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.422409Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:6b30e5cf4a24dff5c1d664218af2da430d5fd442ec8f668dbf71d2ff9659ce02","observation_id":"2e7dff76-7ce8-4d30-b7f3-bfae6a2551ac","resolution":{"observed_at":"2026-08-11T21:49:17.422409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-13T04:25:22.955470Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-08-11T21:49:17.426665Z","title":"ReLU 2 Wins: Discovering Efficient Activation Func- tions for Sparse LLMs.arXiv preprint arXiv:2402.03804,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.426665Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:d3e1e0fa2f2f940e5f3e3ce38bb2bb3a8abcb1487125c55e038ffae82e07289d","observation_id":"40c0a478-58f3-4a12-b0dd-135ab96bcabe","resolution":{"observed_at":"2026-08-11T21:49:17.426665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.039032Z","title":"CONTENTS A Method Descriptions 18 A.1 Expansion of Vertical Decomposition","venue":null,"work_id":"6f7d0635-fc8f-40c5-b92f-cc9ec0091894","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.431778Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:15756a1c2e46937e926fda7b5bc28f6bee89cce6a93e983a6ad1ae144f323644","observation_id":"88ddfaba-7cce-45f2-ab6d-bcace9afc643","resolution":{"observed_at":"2026-08-11T21:49:18.042704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.024883Z","title":"Moreover, the multi-head expert routing probabilities are consoli- dated into single routing coefficients PH h=1 ˆg1 hi and PH h=1 ˆg2 hj, reducing redundant aggregations","venue":null,"work_id":"a6263751-e894-4df7-ae14-90949d4f4393","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.436382Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:30601ccc1d003a0f303bc3180ae666da9442ea557ed484856c1289c086b9562c","observation_id":"5787dd54-254f-43b2-bf12-6405cace9c38","resolution":{"observed_at":"2026-08-11T21:49:18.030720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.996764Z","title":null,"venue":null,"work_id":"e14969fe-fe2a-41d0-98f6-e022c84f8e05","year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.444083Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:0277949bf4754c45a1551a0ff751a3853bcb9cf4cb1b46970a7ae3011df0937d","observation_id":"b521dc35-7029-4b51-819d-64fea07fada6","resolution":{"observed_at":"2026-08-11T21:49:18.001376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.981161Z","title":"b1\", nn.initializers.zeros, b_shape) 16self.b2 = self.param(","venue":null,"work_id":"3bdd4a2b-898b-4c2e-808b-937c8dbd136a","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.447699Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:7edd6bb58d429e8b5f3bd85ae49296c2f2ab70e44780d21f8213b17fcea73e4d","observation_id":"205d08a4-c02a-4e40-9b3f-dce2b2e89ee2","resolution":{"observed_at":"2026-08-11T21:49:17.987633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.967404Z","title":"To manage computational resources effectively, we adopt a group routing strategy wherein the routing probabilities are reused every 4 layers","venue":null,"work_id":"2f991e27-9c90-4f31-9477-41076dd37361","year":2023},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.451221Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:9782bb7d399c55344d9ab112d855e79c5636c146255eea42fcd83a97a25a1e10","observation_id":"2155c7b8-ccad-4b50-88cc-fd5497bd2339","resolution":{"observed_at":"2026-08-11T21:49:17.972085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.954549Z","title":null,"venue":null,"work_id":"c32e0268-db59-4dc9-a8ec-7ce435491483","year":2024},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.454643Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:b0dbf78db1547daac994c407cf14adea55f0907c6226beaa2e57e9975a91fcef","observation_id":"3b6d7aa3-ec52-4887-8481-d7afdbb26e34","resolution":{"observed_at":"2026-08-11T21:49:17.958821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.941361Z","title":"The ta- ble reports the number of experts assigned to each programming language across all routing groups","venue":null,"work_id":"41861ef2-9448-4a45-85b8-320f778d947b","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.459871Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:6334adcfca5d415eb9bf4931972609fb6274b0f3dec7ec081c41032cb7742c5f","observation_id":"d3aad49d-4168-44ca-8d6c-53e51176b194","resolution":{"observed_at":"2026-08-11T21:49:17.945417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.928280Z","title":"\"\" 12#!/usr/bin/env bash 13 14echo","venue":null,"work_id":"34596166-b6dc-4409-a6dd-12ee2af47c85","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.466771Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:8d1f19f2d0bd2137b3fa5750be3725519b2c7a7c7cd47a0049dee1df58f02401","observation_id":"f0ad5e76-b44c-44e2-acc1-27ddb37e82c7","resolution":{"observed_at":"2026-08-11T21:49:17.931920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.913529Z","title":"Based on this, we masked experts associated with each language and re-evaluated the code generation benchmark to estimate the model’s capa- bility to unlearn programming languages","venue":null,"work_id":"25513f5d-6922-443e-b837-e502d0275dc5","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.471020Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:398460d3fc03a04fe8a65631a9515654f41f9a5b1b7b888a987c6c00a2d7708b","observation_id":"248b5d53-cb14-42fb-a7cf-2921df6104fa","resolution":{"observed_at":"2026-08-11T21:49:17.918495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:17.884126Z","title":"JULYIV (...)rew (59.50%)(...)TheembroideryreadsinHebrew:","venue":null,"work_id":"5c5b411b-7278-42a3-a7c7-b53ed254d82e","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.483517Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:bf2ed5774e864abf9314d54ccd7d03e95b7191d97fc5e2e8924a2bdcdac4719e","observation_id":"ff23ca77-efa7-4ac1-896b-d436f02b129c","resolution":{"observed_at":"2026-08-11T21:49:17.890678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.122795Z","title":"BatchTopK: A Simple Improvement for TopK- SAEs.AI Alignment F orum,","venue":null,"work_id":"887c65b3-cd3d-40ef-a290-97f22511187a","year":2025},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.314729Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:7f06751d7bbb9f38c9b8f7dbd92bcb20418207f4900b5aa9fb30713720954a99","observation_id":"5dfbb1be-ff90-4064-873d-92e3824017e8","resolution":{"observed_at":"2026-08-11T21:49:18.126943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06102","last_updated":"2024-06-06T22:59:58Z","snapshot_observed_at":"2026-08-13T04:44:22.555929Z","submitted_at":"2024-01-11T18:33:48Z","title":"Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06102","snapshot_observed_at":"2026-08-11T21:49:17.340410Z","title":"Patchscope: A Unifying Framework For Inspecting Hidden Representations of Language Models.arXiv preprint arXiv:2401.06102,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.340410Z"},"links":{"cited_paper":"/paper/2401.06102","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:7c44325d1386c44ed2af30ff5acd57821fd64fb59d301046cb0b6871bd5faf7d","observation_id":"3be18078-dc49-4ee3-8d8c-5a5a606dd494","resolution":{"observed_at":"2026-08-11T21:49:17.340410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-14T11:01:09.094119Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-11T21:49:17.328429Z","title":"William Fedus, Jeff Dean, and Barret Zoph","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.328429Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:81b8c18d6b48542074f2d781a0ec112e8e4723825ff9566b2a05c021c2678522","observation_id":"38440118-84ef-488e-9c34-51d3bc740853","resolution":{"observed_at":"2026-08-11T21:49:17.328429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.135937Z","title":null,"venue":null,"work_id":"db255138-945f-49ac-97bc-bbfa6fe4d639","year":2023},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.310182Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:d4985225d333f5d1a418a64ceeddec4b7bf723f1f7f763846b3ed1ab4b5cb816","observation_id":"f391b43e-99f7-4df1-b0be-83ca33bcbf8c","resolution":{"observed_at":"2026-08-11T21:49:18.140201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:49:18.110781Z","title":"Mem- ory Augmented Language Models through Mixture of Word Experts","venue":null,"work_id":"71c93b46-f704-4a06-b692-48b3a65fd97a","year":2024},"citing_paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T21:49:17.323690Z"},"links":{"citing_paper":"/paper/2412.04139"},"observation_digest":"sha256:c7183b91725b28845afd3c613a2d4e8430a7b1254851af9dab8f91ccac6f6de7","observation_id":"a2481438-38c2-41c0-b057-1993764de5aa","resolution":{"observed_at":"2026-08-11T21:49:18.114743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04139","last_updated":"2025-06-11T07:36:27Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T00:26:00.692458Z","submitted_at":"2024-12-05T13:06:03Z","title":"Monet: Mixture of Monosemantic Experts for Transformers"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2412.04139."}