{"as_of":"2026-08-15T08:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32de08cc71f87c5987d8bf44753fca98ca90d5cef6729c935c883ca620cc1103","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:12:46.187984Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20875/citation-record","integrity":"/paper/2412.20875/integrity","json":"/paper/2412.20875/citation-record.json","paper":"/paper/2412.20875"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-10T23:12:46.087752Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.087752Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:e6bdcd0a7cb289b5bf0ffcee4f792af9c2f6a5ac090c24375eb5d5e4eb66965f","observation_id":"02e9d718-36b9-4932-8269-6b1409f99352","resolution":{"observed_at":"2026-08-10T23:12:46.087752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.587770Z","title":"(2022)) to column first in order to aggregate row wise scores efficiently","venue":null,"work_id":"1488d62c-85bc-4ee6-9771-ca500ea38e0f","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.180286Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:3b69246e6cb70e989e71d4c54fd63df5e7051518c59289b0bb3cabad989fd307","observation_id":"088ba14c-0a2b-403d-ba18-419097171c2d","resolution":{"observed_at":"2026-08-10T23:12:46.593375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.644505Z","title":"Jordan and R.A","venue":null,"work_id":"1521bee9-ed41-413d-a15a-b5ed12e58743","year":1993},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.129681Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:8d718d8b7d8fcbe037e0ea69f815b863f28673961f54c3b676e44fba5b3dba2f","observation_id":"00862e64-3b68-48fd-9e4b-379e188947fa","resolution":{"observed_at":"2026-08-10T23:12:46.649562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T23:12:46.138122Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.138122Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:6a0682e1715c0cac7493a4c093a276db37341607b502f97361d7d557f6d5535d","observation_id":"87190a05-b759-4a1d-9708-0390f408b66a","resolution":{"observed_at":"2026-08-10T23:12:46.138122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-10T23:12:46.146643Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.146643Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:0ab74e6f96e02fad5ffa7769b2da7c112e879f3fbfd6ad1949b360b1869326f7","observation_id":"2a86ddda-136d-499a-83cb-3a31e445ab19","resolution":{"observed_at":"2026-08-10T23:12:46.146643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.150934Z","title":"Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis, Quoc Le, Geoffrey Hinton, and Jeff Dean","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.150934Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:546ac5979436549c30a94ec336adf79c405744ddba532ec1aefa8eb6fe7c1c6b","observation_id":"6704a57f-4422-4318-894b-8b0789abcc2b","resolution":{"observed_at":"2026-08-10T23:12:46.150934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05558","last_updated":"2022-07-27T17:26:18Z","snapshot_observed_at":"2026-08-14T20:40:27.981488Z","submitted_at":"2020-07-10T18:26:17Z","title":"The Computational Limits of Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05558","snapshot_observed_at":"2026-08-10T23:12:46.154905Z","title":"The computational limits of deep learning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.154905Z"},"links":{"cited_paper":"/paper/2007.05558","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:dd7373529f7c90d221ecf508285db293178730bbb22e206b7d6d15ab1efc0c50","observation_id":"27bebf00-eb55-43b2-9abf-4073af15dfb4","resolution":{"observed_at":"2026-08-10T23:12:46.154905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14458","last_updated":"2024-10-30T01:49:34Z","snapshot_observed_at":"2026-08-12T23:59:58.018406Z","submitted_at":"2024-05-23T11:44:29Z","title":"YOLOv10: Real-Time End-to-End Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14458","snapshot_observed_at":"2026-08-10T23:12:46.159112Z","title":"Yolov10: Real-time end-to-end object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.159112Z"},"links":{"cited_paper":"/paper/2405.14458","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:6c5e6c10a1dd337bd91e3187ae7b864cfd320031faa581f6295a82c2f9dd9ef9","observation_id":"99890f0c-8a5d-4db2-97d2-f5375c338f5c","resolution":{"observed_at":"2026-08-10T23:12:46.159112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-10T23:12:46.163154Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.163154Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:141c0810ddf9c9fee5a779567adec00c38bbb72c2905bdc51e14391783bc80f1","observation_id":"3da45293-e846-4a9e-a604-09ac8a17a533","resolution":{"observed_at":"2026-08-10T23:12:46.163154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.560310Z","title":"Algorithm 1 A-MoD with Flash Attention, modified from Algorithm 1 in Dao et al","venue":null,"work_id":"4d98d154-864a-4894-b128-0a35e604488a","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.187984Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:dbca3aac4abd0669774883e4758af54c3b37f4b1e9393e15a77ad8ba336a9649","observation_id":"134746bd-5b84-4a9d-8c10-c378edd381e7","resolution":{"observed_at":"2026-08-10T23:12:46.566158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.616460Z","title":"Fine- tuning with A-MoD: Results comparing A-MoD with standard routing and isoFLOP baselines for 12.5% capacity on ImageNet-1k","venue":null,"work_id":"1e888a49-e24c-4a51-94d9-4420df16c2ea","year":2015},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.171424Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:fcc2f1d01d81bb3e6a3851514411d8fb820718bcc2fc11d6ec0ac0b5909e0f6f","observation_id":"020580f2-c3a5-408a-bb1c-a200fb483b4a","resolution":{"observed_at":"2026-08-10T23:12:46.621253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.602469Z","title":null,"venue":null,"work_id":"dc175030-b115-402e-965c-1ff3ee9288e1","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.176046Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:036ab27daa8ed7cd8f9cf17a937f641b36fa8d0c868e3253a70990f93d8c5917","observation_id":"c350d607-1bcf-4e6b-8f02-80b0ee826065","resolution":{"observed_at":"2026-08-10T23:12:46.607502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.575638Z","title":"We compare with the baseline results provided in Table 11 in Bolya et al","venue":null,"work_id":"4abb035b-6605-4c30-819f-329c4abb0b1a","year":2022},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.184163Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:cfd52037d6737338033da8caef44cc0ccf80ecd30a7551723ee8e8d8e3b416c7","observation_id":"abce2d01-e0ec-404e-a0b9-2cab9df573f2","resolution":{"observed_at":"2026-08-10T23:12:46.579883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19985","last_updated":"2024-07-30T17:26:22Z","snapshot_observed_at":"2026-08-12T23:12:53.105235Z","submitted_at":"2024-07-29T13:19:31Z","title":"Mixture of Nested Experts: Adaptive Processing of Visual Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19985","snapshot_observed_at":"2026-08-10T23:12:46.121178Z","title":"Mixture of nested experts: Adaptive processing of visual tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":1991,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.121178Z"},"links":{"cited_paper":"/paper/2407.19985","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:390815d9c7c5be862c9444cfe5556b1e0f82cd3736513a0978b2700f64ebb172","observation_id":"9c40a882-05a8-4aad-ae4a-64124aa97d76","resolution":{"observed_at":"2026-08-10T23:12:46.121178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.134066Z","title":"Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.134066Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:f92260ecec9d889974b3e98e8a4083e0260e221f6ca56edcbc84a3464a5c3fce","observation_id":"8253f738-8fa0-4bf4-bb50-462bad4cf955","resolution":{"observed_at":"2026-08-10T23:12:46.134066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-14T07:20:22.540923Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-10T23:12:46.102638Z","title":"Token merging: Your vit but faster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.102638Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:8202311470ccc8d155e7bacd34d8eb072500fad3f2348da4ff8036e2ec9e46ba","observation_id":"ed50a281-0131-40d9-ae4c-89e9872549e7","resolution":{"observed_at":"2026-08-10T23:12:46.102638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06297","last_updated":"2016-01-07T22:41:10Z","snapshot_observed_at":"2026-08-14T22:22:10.782232Z","submitted_at":"2015-11-19T18:40:22Z","title":"Conditional Computation in Neural Networks for faster models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06297","snapshot_observed_at":"2026-08-10T23:12:46.093201Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.093201Z"},"links":{"cited_paper":"/paper/1511.06297","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:8ea809aa6f6ba8c5f5680eb8637ce3e0ac2a110d1fb1fa077e6d52b740c906fc","observation_id":"10aa2906-3976-4f60-96de-d1435e10a95b","resolution":{"observed_at":"2026-08-10T23:12:46.093201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-10T23:12:46.098087Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.098087Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:c519cfca2a94268112ca8c09fc65ab9342df3b5405e2b7760b5b7fe077b7f829","observation_id":"b6685bac-5984-48f2-b2bf-608fa9348939","resolution":{"observed_at":"2026-08-10T23:12:46.098087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T23:12:46.116329Z","title":"Train- ing compute-optimal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.116329Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:1cfbaefbf903bd68816c4f09c0335f66c57612ec59bfb5b2d7657b3ae1633f11","observation_id":"d639b5f7-ce2e-46e4-8a0a-740caa441742","resolution":{"observed_at":"2026-08-10T23:12:46.116329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.630640Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":"4597777c-dc1a-4b63-b6a8-2e36d992f2f1","year":2024},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.142501Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:b32069bc24aa130c20ae2d2e672141c39e77d6f3a0de5852c51f07365fa5cd2e","observation_id":"348de185-fa69-4036-bd7f-3795ac587e3c","resolution":{"observed_at":"2026-08-10T23:12:46.635097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T23:12:46.125395Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.125395Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:f4ea884e7585cd6049ec4a8e87e645a0b3c485e758f92ae51873cc039198dde2","observation_id":"01e2d03d-8dd9-49af-ad4d-cb50e9fd82c5","resolution":{"observed_at":"2026-08-10T23:12:46.125395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-14T11:01:09.094119Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-10T23:12:46.111458Z","title":"William Fedus, Jeff Dean, and Barret Zoph","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.111458Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:9d74d25e972ec35bbba3c459c71ec1ed88d88b6b104896831c8bc4e93622b031","observation_id":"f5cdce41-7bdf-4b43-9721-f538f0b5ae2e","resolution":{"observed_at":"2026-08-10T23:12:46.111458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-10T23:12:46.167415Z","title":"ST-MoE: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.167415Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:a64866eb67c7ad2b507b906b56e195c5e753c4416f854dafe8025d2fff6c4df5","observation_id":"ce6f1959-a86d-44eb-9857-b58a40be3fa6","resolution":{"observed_at":"2026-08-10T23:12:46.167415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:12:46.657847Z","title":"On the benefits of learning to route in mixture-of-experts models","venue":null,"work_id":"b26e8c9b-7ee1-4eb8-814c-75e7a560e984","year":2023},"citing_paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:12:46.107011Z"},"links":{"citing_paper":"/paper/2412.20875"},"observation_digest":"sha256:b4174e7d266691f4d37efd85203991c5d11a1d3b474e0985d2e543fd31aa677a","observation_id":"7464dd74-b32d-4f9b-860b-c31d48d3842a","resolution":{"observed_at":"2026-08-10T23:12:46.662404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20875","last_updated":"2024-12-30T11:25:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:58:52.922879Z","submitted_at":"2024-12-30T11:25:54Z","title":"Attention Is All You Need For Mixture-of-Depths Routing"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2412.20875."}