{"as_of":"2026-08-17T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78711e2623ffc3adfc18d47733493a40462053b48181b61c305166c3b021eb50","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:52:42.980950Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:50:40.854420Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T23:49:10.742674Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":"2505.00315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","venue":null,"work_id":"2657c7cd-bbb5-44d4-8e0d-e5f8895c155f","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-08-14T13:38:50.524779Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:db408900ea6a7d71f075bba7735a42c752497cda55faecadae3006681caec732","observation_id":"0f65d681-9848-4316-9905-dd2d8b9b35f1","resolution":{"observed_at":"2026-05-12T09:04:34.904141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-08-07T14:50:40.854420Z","title":"Mixture of sparse attention: Content-based learnable sparse attention via expert-choice routing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17412","last_updated":"2025-05-26T17:47:04Z","snapshot_observed_at":"2026-08-15T02:14:10.295203Z","submitted_at":"2025-05-23T02:58:01Z","title":"Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:50:40.854420Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2505.17412"},"observation_digest":"sha256:f5f5e73741ec01f24fe2f20b02052adfbc7913ca8012735134d3d6799c160a09","observation_id":"f4cc3e69-8378-4209-97ef-a5df07deff95","resolution":{"observed_at":"2026-08-07T14:50:40.854420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":"2505.00315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","venue":null,"work_id":"2657c7cd-bbb5-44d4-8e0d-e5f8895c155f","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:953f2cc3b4164f6e31c64b15f4c3d5bf6f5034fc78459f3c919d788c295e3b87","observation_id":"4f23b4b7-3f5f-4dcb-ba2f-797b46b5f675","resolution":{"observed_at":"2026-05-13T23:49:10.746854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-08-03T04:55:42.586782Z","title":"Mixture of sparse attention: Content-based learnable sparse attention via expert-choice routing.arXiv:2505.00315 [cs.LG],","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03681","last_updated":"2026-06-02T17:25:15Z","snapshot_observed_at":"2026-08-11T02:19:25.991798Z","submitted_at":"2026-02-03T16:02:50Z","title":"Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:42.586782Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2602.03681"},"observation_digest":"sha256:db00f67d3c1a408d9ebf38a0d8c220589929e39f199d78c3864adb42f164edb8","observation_id":"f25861fd-44c6-427a-8979-dc85ce5d1a07","resolution":{"observed_at":"2026-08-03T04:55:42.586782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00315","snapshot_observed_at":"2026-08-03T01:00:44.103650Z","title":"Pi˛ ekos, P., Csordás, R., and Schmidhuber, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.03335","last_updated":"2026-06-29T17:33:41Z","snapshot_observed_at":"2026-08-03T01:00:42.799874Z","submitted_at":"2026-02-11T16:06:59Z","title":"Compressed Sensing for Capability Localization in Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T01:00:44.103650Z"},"links":{"cited_paper":"/paper/2505.00315","citing_paper":"/paper/2603.03335"},"observation_digest":"sha256:41302a0e36228d06ea195a96416b37e81b4d35ff1367427119353237e12ebdc3","observation_id":"fcfbf863-46b7-49e3-a72a-577cafc0a4c3","resolution":{"observed_at":"2026-08-03T01:00:44.103650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00315/citation-record","integrity":"/paper/2505.00315/integrity","json":"/paper/2505.00315/citation-record.json","paper":"/paper/2505.00315"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.218902Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"4309ae67-eaeb-4555-9a60-5bdd93298a5d","year":2017},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.643370Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:60d977117a819c701acbd5aed5817481099e904d87fa007f462d35636bd87518","observation_id":"6ffe46a2-863b-4131-ab72-d1e2c3f6aa17","resolution":{"observed_at":"2026-08-16T04:52:44.224119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.202694Z","title":"Language models are few-shot learners","venue":null,"work_id":"729b127c-bbcb-4fad-8023-da8d691fc612","year":1901},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.648989Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:6cea31899cc91d7673525192d163154deec92b16b385246b00c39a8ba33b7f80","observation_id":"674f59e8-ccd2-4108-97ed-e8f0ec5351d5","resolution":{"observed_at":"2026-08-16T04:52:44.207678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T04:52:42.654726Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.654726Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:f0da5967f1f7e02490b34e30f3539b984fce26a82fc07d4e95c734a5eed5ec78","observation_id":"91dd2db4-7c89-428d-9f6f-e0d65fd878f6","resolution":{"observed_at":"2026-08-16T04:52:42.654726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T04:52:42.660221Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.660221Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:db159a4f5a0ab1bf44ad5c86a78b410d6401c8ab8c67f07410525fc1320992a5","observation_id":"f7a101a1-bf2e-47f8-bfcf-e4ea9790c109","resolution":{"observed_at":"2026-08-16T04:52:42.660221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T04:52:42.665341Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.665341Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:90a02747c6b398c682232d72dd7b2a3bd03b39e243b8e6929862b51fc7e76360","observation_id":"48ce76c7-5857-46aa-b289-193c85a33b0b","resolution":{"observed_at":"2026-08-16T04:52:42.665341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.187391Z","title":"Hippo: Recurrent memory with optimal polynomial projections","venue":null,"work_id":"6e561fca-31b1-4f4e-b233-6534f311588b","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.670227Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:7ff749065906fe7cc09919159f147097eb5bf5e077325556bae936f5a6d9409c","observation_id":"8c458f3a-e21d-4839-a237-5d2d2b2276cb","resolution":{"observed_at":"2026-08-16T04:52:44.192500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.171266Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"b090e082-4de4-4a1f-b369-c3efd31bd9c6","year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.675684Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:aa9edc8337f25ef2b08e178c0999fc1917c2ccd69c236e5e9de286863688c2e8","observation_id":"1bb58af2-4c9a-42a6-8bab-d1ab1a90b995","resolution":{"observed_at":"2026-08-16T04:52:44.176868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T04:52:42.680870Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.680870Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:cbb4fd0225743ec8cbbe1060c8e2b53a5ac476df46e26e2572cdd17969a569a0","observation_id":"2aac7d60-4c0f-470f-aac9-af63c01643e5","resolution":{"observed_at":"2026-08-16T04:52:42.680870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09516","last_updated":"2024-04-15T07:24:45Z","snapshot_observed_at":"2026-08-16T14:00:57.645590Z","submitted_at":"2024-04-15T07:24:45Z","title":"State Space Model for New-Generation Network Alternative to Transformers: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09516","snapshot_observed_at":"2026-08-16T04:52:42.685702Z","title":"State space model for new-generation network alternative to transformers: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.685702Z"},"links":{"cited_paper":"/paper/2404.09516","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:96ebe65e58d023dcb083afe3313d1552e43f26be2fb7b3d67429b4a4a75f5c43","observation_id":"fa12ccc4-ccf4-4ceb-8ffa-a31e03fc3f12","resolution":{"observed_at":"2026-08-16T04:52:42.685702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.156291Z","title":"Gated delta networks: Improving mamba2 with delta rule","venue":null,"work_id":"d812bd47-b4ad-4bce-8641-c7fd845c5568","year":2025},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.690539Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:be4d5352379dd5b00ab962e951c7a31394b51361753cdbdadfb1aabf7128a0ed","observation_id":"ac61648f-4276-46d8-810f-49f57fe562f6","resolution":{"observed_at":"2026-08-16T04:52:44.160948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.141212Z","title":"Can mamba learn how to learn? a comparative study on in-context learning tasks","venue":null,"work_id":"236c9e8a-5807-47c9-a766-4fcea3b3b669","year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.695560Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:cd5ebfca3adf9be25c3a7e5534afe9e0f792dd0436e2162c284fcf604229bd15","observation_id":"05ec2dcc-a059-4b42-8a3b-8d6654176d42","resolution":{"observed_at":"2026-08-16T04:52:44.146094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08136","last_updated":"2022-12-15T20:51:27Z","snapshot_observed_at":"2026-08-16T16:08:18.026185Z","submitted_at":"2022-12-15T20:51:27Z","title":"Efficient Long Sequence Modeling via State Space Augmented Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08136","snapshot_observed_at":"2026-08-16T04:52:42.700496Z","title":"Efficient long sequence modeling via state space augmented transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.700496Z"},"links":{"cited_paper":"/paper/2212.08136","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:1547a041a50538d2ec94bb1e132958fd046481499cb376a95c16a87fd365f52b","observation_id":"1c99e954-aa90-4c3d-bf08-e9a814bf49d9","resolution":{"observed_at":"2026-08-16T04:52:42.700496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-16T04:52:42.705462Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.705462Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:ecd38e623cab6d3b821da63396cbbaf29bb09df6a92424bdd6146dbce95d7954","observation_id":"67fb8af9-c2f8-4d10-a259-e0b36483457e","resolution":{"observed_at":"2026-08-16T04:52:42.705462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.125422Z","title":"Transformers are RNNs: Fast autoregressive transformers with linear attention","venue":null,"work_id":"f45a4f2b-a534-4b66-ab65-ceccbcc6be51","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.710076Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:62400f6c3ba83487f108262a1369db7954eba5439125bf8349cc4fd9d3e1c659","observation_id":"8f6f22cd-8b27-4e6c-b2cc-ec3d6af6c1ef","resolution":{"observed_at":"2026-08-16T04:52:44.130775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.109640Z","title":"Linear transformers are secretly fast weight programmers","venue":null,"work_id":"e57225e7-8333-4249-bcdd-e573dfedf229","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.714879Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:f752482d4f50dbdd548dd8c3e41859be72887de0e1f040b6f20a397644e62960","observation_id":"ea397617-3235-4149-936b-8cfced97bd80","resolution":{"observed_at":"2026-08-16T04:52:44.114816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.094363Z","title":"Learning to control fast-weight memories: An alternative to recurrent nets","venue":null,"work_id":"91f5ea42-54f0-494e-93d9-59fd9528326d","year":1992},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.719394Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:36232a392a510e6c383f6d70cdf2537c22378ebcd6b0ecbe75a4db95c70cd1bb","observation_id":"5f9e71b4-79a4-4a3e-a4ac-65cc9b65590e","resolution":{"observed_at":"2026-08-16T04:52:44.099246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.079042Z","title":"The devil in linear transformer","venue":null,"work_id":"32d0d32f-af02-426f-93b7-d8c32f1383cb","year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.724082Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:94c311f109a3879efcbad0ebfa036c40d46756b96645857ba39c8a9140613eea","observation_id":"1bbffd0b-34fc-4ef1-af68-49f7f5cc809e","resolution":{"observed_at":"2026-08-16T04:52:44.084166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-16T04:52:42.728840Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.728840Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:fdabc33547ef852a0a37eaa5310d4e53ed0633e7d91269c7101872bf30aa6009","observation_id":"0d691b61-08d4-466c-80ad-36e77e8075ea","resolution":{"observed_at":"2026-08-16T04:52:42.728840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.063840Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"8cf54ab6-7649-4264-9acb-79cb1160f85d","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.734113Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:14186182204554a3c011ec18cc364da56b1a2e6b35632a41ad9041cfff80961b","observation_id":"4cfdd99c-a404-448e-ad95-aab8059a0385","resolution":{"observed_at":"2026-08-16T04:52:44.068864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T04:52:42.739379Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.739379Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:98905ef9918701d618b430960ac0b55cdce296e6604f03721e70e15ab787534f","observation_id":"7efdb529-dcee-4dbf-8c6d-f1ffbc3b2665","resolution":{"observed_at":"2026-08-16T04:52:42.739379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.048000Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"d6a8105e-d05e-4792-a891-28f0059d0b15","year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.744417Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:47644dbcf197b4576b60ab318bd519c8cb68de7917d3321d991bb9261a377612","observation_id":"c6d61473-7ce8-4334-a02b-bb4989fdef97","resolution":{"observed_at":"2026-08-16T04:52:44.053184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.031860Z","title":"Repeat after me: Transformers are better than state space models at copying","venue":null,"work_id":"85c69e14-03d0-4d32-ac33-27463e8bf3f8","year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.749362Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:7823db5d094506fa7e3c9e579f00b485911f7f550b63f477f6db3ea65e3f6184","observation_id":"addfc2b1-0a86-40d9-b487-4a59362fab1e","resolution":{"observed_at":"2026-08-16T04:52:44.037376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:44.013196Z","title":"Synthesizer: Rethinking self-attention for transformer models","venue":null,"work_id":"1bb1cdd6-5dc7-4907-89eb-837e56730adc","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.754336Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:0d9fda17602897ff45b67a9057b03aa235ad2ed7bdb413a5b025bf1a883d47eb","observation_id":"97d27218-b36a-437c-a8f8-22d69a02fa89","resolution":{"observed_at":"2026-08-16T04:52:44.018801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.995709Z","title":"Fast transformers with clustered attention","venue":null,"work_id":"bcb8bc78-1142-4cc4-9eef-434da0d50afa","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.759015Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:c650f83c1f31092ee2a46d757b6249b9a305d77feb86939383d7f72922dfa72c","observation_id":"ee94e54a-849a-4911-948e-6b3bddeb566a","resolution":{"observed_at":"2026-08-16T04:52:44.000975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.979492Z","title":"Efficient content-based sparse attention with routing transformers","venue":null,"work_id":"d109eec5-5fc6-4935-94d7-611d47601bce","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.763681Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:4f3db36b903b8a9bbeb73a8a2808bc06450f8356debd3c2b92951e7defbe5b2e","observation_id":"f2c2e1d2-2661-4b26-8489-8bfa366804bb","resolution":{"observed_at":"2026-08-16T04:52:43.984740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.963443Z","title":"Convergence properties of the k-means algorithms","venue":null,"work_id":"b8ee022c-2632-45c2-94d9-aa37c4fcab02","year":1994},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.768182Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:cea71859a88c9c50aae32fb0024f673ba1bae8f083a89bcff7b2e0f1b9f08d53","observation_id":"df8e47a9-ec21-48a9-addb-6d04c5449279","resolution":{"observed_at":"2026-08-16T04:52:43.968945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.947594Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"070b36b7-6dff-4c47-a4bf-45c5695f4a70","year":2017},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.773368Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:8f0acc33f7a7940f6df2e67319896f78497b9280ae056d0ba79c3bf0bec53573","observation_id":"8387212e-ab68-433a-b34f-bc2c855ba7bf","resolution":{"observed_at":"2026-08-16T04:52:43.952806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.931990Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"1b142a6d-426a-4607-9bc1-910edecfab0f","year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.777852Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:0556e3eeb630bd16c6af8280bb6bd799fca01e27dc7da138c86dc738889c2c52","observation_id":"c6c83f20-df69-4dae-a95b-46562b2bc867","resolution":{"observed_at":"2026-08-16T04:52:43.936979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.915852Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":"01fd2f5c-87a1-42ab-b174-ac7f54ed5c66","year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.782593Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:b87725e3048e35d53cf4e30b779c541c92e08cb6d51a4e49eed0c35f85d5607b","observation_id":"86b2eedf-af5c-49a7-bc8a-1e6fbca0fb32","resolution":{"observed_at":"2026-08-16T04:52:43.921276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.900377Z","title":"Mixture of attention heads: Selecting attention heads per token","venue":null,"work_id":"bb1bf915-35f3-4938-b2c6-539fa2cd55ba","year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.787352Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:24b46665f4465ad0854610fb9a854e59337832139403aeebf075b20e2d8c5b24","observation_id":"40ceb9a9-6dec-4361-bd20-11a248e593fa","resolution":{"observed_at":"2026-08-16T04:52:43.905349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.884833Z","title":"Switchhead: Accelerating transformers with mixture-of-experts attention","venue":null,"work_id":"a75cf7c0-a911-4fc0-a5b3-d0aa700768ae","year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.792226Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:11a2834c9527cf41634c701c25072b9d8cb27f98000b23dcb3228ad055b12de8","observation_id":"66d13f37-05af-476e-84c3-2fc369ac3bc5","resolution":{"observed_at":"2026-08-16T04:52:43.889574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.868908Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"1ade8232-66e0-4875-9240-216cb9ae9a8d","year":2023},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.796704Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:16d141a5fe927d95f9c2dea6412a87630c0d03d7faabec95d799f5449a370ddf","observation_id":"404a9814-60c1-4209-abab-8565ce79ca5b","resolution":{"observed_at":"2026-08-16T04:52:43.873901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.853522Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":"e77d6768-b166-4346-9335-a1beaaeeca6a","year":2025},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.801397Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:caa85e095013087d061855a985af777c5e54c35f26aab1e333ccbb17c109b6cb","observation_id":"068ccfb6-5994-4b9f-acd8-dfd75eb1e226","resolution":{"observed_at":"2026-08-16T04:52:43.858773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-16T04:52:42.805826Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.805826Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:76c4779e2d8c157b3104401738697e1fb3a363ab33a536c47966a4cf6795f4fe","observation_id":"8e0e9331-2999-4271-9779-af49e3cf5bc0","resolution":{"observed_at":"2026-08-16T04:52:42.805826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.837667Z","title":"Gshard: Scaling giant models with condi- tional computation and automatic sharding","venue":null,"work_id":"3c886da8-4be6-4abf-b131-cee4b20cf5bc","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.810979Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:dd9ad27cc684dfab654f59a5f6c4c6b87fffbce1ac164ed0601785b4856be766","observation_id":"f2a9a438-53bb-41fc-b1fb-d0332739004b","resolution":{"observed_at":"2026-08-16T04:52:43.842793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-16T04:52:42.815663Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.815663Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:2841931936c971ec3aaa4d6c0307da860917f3f3669fb20917dc4be47dd33525","observation_id":"b34db213-1b34-4e7e-9ebe-7e090f1a3c82","resolution":{"observed_at":"2026-08-16T04:52:42.815663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-16T04:52:42.820722Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.820722Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:4ee389e0f5644291faad22015a89a54ffa8939b181fa3d320b7c171879aa5f7d","observation_id":"540e4f27-5d6a-413d-a5e0-29a29372d88d","resolution":{"observed_at":"2026-08-16T04:52:42.820722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.821774Z","title":"Approximating two-layer feedforward networks for efficient transformers","venue":null,"work_id":"eb46758a-ca76-4b11-a126-de228ede56bd","year":2023},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.825493Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:732cff5b0dfe4229f580d37243ad91cd616a1a8b0facc7334523260eecd94bed","observation_id":"a0f0f4a1-1786-4b40-b9bc-752f5ffb27c0","resolution":{"observed_at":"2026-08-16T04:52:43.826772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.806209Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"74e3464d-bc7b-4016-9eed-108db4c18627","year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.830748Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:44a367cababe60a664e2353b90550137fcf5da8e634c8c43bc49f6d3a5fbdea3","observation_id":"9f9b3ef3-6f8a-4be0-8881-7b62eb8a16d8","resolution":{"observed_at":"2026-08-16T04:52:43.810921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.790302Z","title":"PyTorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"87a2f1c1-3dba-4b98-b6fc-771e2dc680e7","year":2019},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.835539Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:f38072408de500b5acebf0010f934b8d82e13919eef9e73298eb403d55bb2b8c","observation_id":"260485ec-4af5-4deb-bfdf-929c0c6a062f","resolution":{"observed_at":"2026-08-16T04:52:43.795491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-16T04:52:42.840198Z","title":"RoFormer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.840198Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:7db469451dc9770932ad331b299dbfadc4a2197e7ea86dbf0f535c9c26e26805","observation_id":"efdf7b8b-469b-4b49-bbf9-c64c0cf4550c","resolution":{"observed_at":"2026-08-16T04:52:42.840198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.774416Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":"475950a3-f0c5-44d5-b9fa-e840d154100e","year":2018},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.845137Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:04e30a6fc53b88a11e6895311a1d67af19b0cdffd5391b582575ede18b6ba0f6","observation_id":"20dc7b7d-80f4-4ead-b1a5-75700f890705","resolution":{"observed_at":"2026-08-16T04:52:43.779647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.759349Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":"72da1020-1ae7-4de6-81ef-a25471d4ddd7","year":2016},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.849839Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:7c39b29b1c9e236f021bb26461045285bdd98832e6804bf26dc55a0425868ded","observation_id":"106e6762-b25e-4913-9f2f-ba02c232126c","resolution":{"observed_at":"2026-08-16T04:52:43.763986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.743566Z","title":"Japanese and korean voice search","venue":null,"work_id":"a1949f84-2758-4c8e-93b4-c676cbe26ab2","year":2012},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.854520Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:7c13bc6f6eb754f1dab1eb76078cdc0726797f66d7d4e7a813618b7a4625484d","observation_id":"13a8ad77-0d31-4b57-8bb4-189a7a2b2451","resolution":{"observed_at":"2026-08-16T04:52:43.748580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.727062Z","title":null,"venue":null,"work_id":"93b8bc7d-3197-4855-9cae-513e9362da9e","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.858797Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:b26c87d823382fd6269b0529b65c2b4626f58c7be4882dc0cd88eae8c0ec8dac","observation_id":"7928e4c9-ef5d-4856-8d7c-a4e71a6318b8","resolution":{"observed_at":"2026-08-16T04:52:43.732176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.711446Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"4c801d03-fbf2-4c43-95e1-38835435b7b7","year":2015},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.863506Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:9059a64814dc45244830d23dd4661f03f0b02930881b71eb5a954dfda6259269","observation_id":"52f149fc-d2a9-4d29-b030-70009d6acbb7","resolution":{"observed_at":"2026-08-16T04:52:43.716134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.696319Z","title":"Efficient long-range transformers: You need to attend more, but not necessarily at every layer","venue":null,"work_id":"33076312-d793-437d-9e97-4394bdec20e3","year":2023},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.868066Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:58a0123cbe36f4ad66a131a34279f953b055da2d3bab466aba209275b14174cd","observation_id":"6927aca1-407f-4441-80c7-bf8056d56456","resolution":{"observed_at":"2026-08-16T04:52:43.701133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.681225Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"5a1811a6-2a62-451b-86ee-47ea4c52b379","year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.872806Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:c263ec556c7549e2a476cb357e522f3b4f972b77af1a7ba417d5c9b372b0d663","observation_id":"7eaf45c5-b634-4aad-96c7-2ade3ee33bd8","resolution":{"observed_at":"2026-08-16T04:52:43.686297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.664930Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"5a97ccf6-607a-46a5-8bd2-2693019653f6","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.877448Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:cb733c940d6ef1587d43ed792761ca2c8e5a2b68c8dfe7e2f40e30450b4e3864","observation_id":"8a18061e-fa5b-4bd0-b2a7-b2857453d871","resolution":{"observed_at":"2026-08-16T04:52:43.670935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06214","last_updated":"2025-04-08T16:58:58Z","snapshot_observed_at":"2026-08-16T12:42:55.931657Z","submitted_at":"2025-04-08T16:58:58Z","title":"From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06214","snapshot_observed_at":"2026-08-16T04:52:42.882354Z","title":"From 128k to 4m: Efficient training of ultra-long context large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.882354Z"},"links":{"cited_paper":"/paper/2504.06214","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:2b2b87d720fb5e04d861d91b9b177ee8fe949a5c22a2135a4ad4034056595415","observation_id":"a68653d7-a2a5-4ebc-9829-364d2e885a1b","resolution":{"observed_at":"2026-08-16T04:52:42.882354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.649581Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"9b6d8319-d8ed-46f0-89cc-0f181ddec6a1","year":2016},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.887590Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:b8681a761171cd97a42dfa645841d66842e2099189cadd960e1f724e94b73ae5","observation_id":"8abcdbb1-12fb-489c-b272-c76849a03c66","resolution":{"observed_at":"2026-08-16T04:52:43.654662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.631978Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"22091553-e8fb-40a3-bf49-86cd71b3e4e1","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.892242Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:7595c977643b20024553c37137830a58efe799bb0346e4f9d320e4b193118d42","observation_id":"926df9c5-1339-4702-85ee-24bd588191ff","resolution":{"observed_at":"2026-08-16T04:52:43.637170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.615409Z","title":null,"venue":null,"work_id":"6080afab-4a8d-4ecd-bba7-404153010377","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.896965Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:6378a5043037380f272047dabb0b01e09854789ea100222789a99320ac9b0556","observation_id":"c8650606-3e83-4abf-9c84-1a20e0a5ab4b","resolution":{"observed_at":"2026-08-16T04:52:43.620251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.599676Z","title":"Hellaswag: Can a machine really finish your sentence? In Proc","venue":null,"work_id":"7780b0e7-874b-4e23-b36e-ea722bcb38c9","year":2019},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.901458Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:a69f7b765d49501fee7ea5e8c111a10559bdcbc2e590a4bdebaa8ed205eeebd5","observation_id":"d6316431-8fcc-4494-a085-b5da17a2ab6b","resolution":{"observed_at":"2026-08-16T04:52:43.605098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.582896Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":"aab40a4a-95cd-495d-b34d-824372618ccc","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.906082Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:75abe88c57f2f0a3b2fad17b8da361ab715b2dc5612211a285158e844fdc4e60","observation_id":"fe870209-235a-49c6-a1a7-b8a962d5a49d","resolution":{"observed_at":"2026-08-16T04:52:43.588331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T04:52:42.910654Z","title":"Think you have solved question answering? try ARC, the AI2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.910654Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:119538f674afca5036e5ff90193c45120da4a26154cc6db689c8af7cf906cac2","observation_id":"3237c19b-e70d-4994-af15-989c465d88ac","resolution":{"observed_at":"2026-08-16T04:52:42.910654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-16T04:52:42.915842Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.915842Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:891332b7760e12531f8d6458404d86b8585c003529deede7e41a40020c8ba2b4","observation_id":"9c6e41d7-ed50-42bc-9510-20c0b9faba5c","resolution":{"observed_at":"2026-08-16T04:52:42.915842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.565660Z","title":"Mixture-of-experts meets instruction tuning: A winning combination for large language models","venue":null,"work_id":"db7908a6-361e-4778-8c41-726d8ce42ea0","year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.921942Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:f17d4d606c5ccbdbf9b45349d028cf4c064cb13b31a6c8ac0c640b4986facea8","observation_id":"c682383a-237a-4114-80ae-88bc4e88622b","resolution":{"observed_at":"2026-08-16T04:52:43.571391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.547903Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":"6ebde501-72b1-46f7-a791-88f07ca14b62","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.927034Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:c9f72c26e2a1e02f84b4becf1e39913923a8d5cc00a94f6f71808601d0df6d35","observation_id":"72b5a80f-a5d2-47f2-9670-fa53bd23be89","resolution":{"observed_at":"2026-08-16T04:52:43.553736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12094","last_updated":"2025-06-02T11:46:43Z","snapshot_observed_at":"2026-08-16T20:57:29.174467Z","submitted_at":"2024-12-16T18:58:57Z","title":"SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12094","snapshot_observed_at":"2026-08-16T04:52:42.932977Z","title":"Sepllm: Accelerate large language models by compressing one segment into one separator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.932977Z"},"links":{"cited_paper":"/paper/2412.12094","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:763b04620c4aa75bed3570894cb40fe63c1f462fc29de1928c2f75f5a9caca3b","observation_id":"37c1e652-bb81-454c-8fea-b1eae7554690","resolution":{"observed_at":"2026-08-16T04:52:42.932977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14468","last_updated":"2025-06-03T21:55:57Z","snapshot_observed_at":"2026-08-15T15:39:14.128434Z","submitted_at":"2024-12-19T02:34:15Z","title":"HashAttention: Semantic Sparsity for Faster Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14468","snapshot_observed_at":"2026-08-16T04:52:42.938149Z","title":"Hashattention: Semantic sparsity for faster inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.938149Z"},"links":{"cited_paper":"/paper/2412.14468","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:5e09556c267803425082f020d15aa2df5f90048a68cd248523775be8f9ac15b4","observation_id":"af926aaf-0c33-4cb9-a55f-affd6ca805c8","resolution":{"observed_at":"2026-08-16T04:52:42.938149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T04:52:42.943317Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.943317Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:2e6d914be82d3a83b797153d822c614abdd7983a2166440608a848e3d6c481aa","observation_id":"5470def8-36dd-4460-9cb2-799047e85e25","resolution":{"observed_at":"2026-08-16T04:52:42.943317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-16T04:52:42.947854Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.947854Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:92498ea01cdb44a4fd7048ccebd7f9258783ee39688073baff7f81d6902b872f","observation_id":"1328b48e-5b56-413a-9dbe-101658e6fea7","resolution":{"observed_at":"2026-08-16T04:52:42.947854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07413","last_updated":"2024-04-11T00:52:39Z","snapshot_observed_at":"2026-08-16T14:01:54.431970Z","submitted_at":"2024-04-11T00:52:39Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07413","snapshot_observed_at":"2026-08-16T04:52:42.952805Z","title":"Jetmoe: Reaching llama2 performance with 0.1 m dollars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.952805Z"},"links":{"cited_paper":"/paper/2404.07413","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:5b8f0491f9210c3de1f7c7acd20440111df30b5337fbd632a7929da5c0fc1ac7","observation_id":"3dd3f17d-e420-4b1e-820c-a11159d64c59","resolution":{"observed_at":"2026-08-16T04:52:42.952805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.531259Z","title":"BASE layers: Simplifying training of large, sparse models","venue":null,"work_id":"e9be54d9-be95-4b68-8ce1-c3ad260f4e28","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.957515Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:ca4bb8cbb190212f2f949394aa73cd727e38d6d200106c478789e40d8df754b2","observation_id":"2649bc52-0510-4976-843f-38fce4bc8391","resolution":{"observed_at":"2026-08-16T04:52:43.536768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.514724Z","title":"Hash layers for large sparse models","venue":null,"work_id":"709ec908-924e-41f0-aff0-0efaad37e212","year":2021},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.962066Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:90491dc3d3906199546841d03847694dae3587d43807f684a510192e2b4e25e0","observation_id":"ddd8c8bf-02a6-4bc5-88ec-d1072d47624e","resolution":{"observed_at":"2026-08-16T04:52:43.519827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-17T04:55:07.787141Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-16T04:52:42.966946Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.966946Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:9d71b096dba4755359eb13f02476c42517d0c1d164ab899c0e0494dceb1cee7a","observation_id":"d9ffbcb7-b545-4f82-bb0b-6c49303dc3f0","resolution":{"observed_at":"2026-08-16T04:52:42.966946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:42.971702Z","title":"Moh: Multi-head attention as mixture-of-head attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.971702Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:e19670b24cadae58ed6495cb7feeb9c541924767e5b682a943fc1a42178f70eb","observation_id":"24d6827b-5f61-4018-91df-4fb99563fb41","resolution":{"observed_at":"2026-08-16T04:52:42.971702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.498308Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"f2adf09c-f9a8-4061-90f2-518ca2477f1b","year":2023},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.976264Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:388202869fae9453de996f8956ffd1a790f09ba38507e90d6dc8ff0f044c291e","observation_id":"66ae2599-b207-4fed-a290-21723eca9b69","resolution":{"observed_at":"2026-08-16T04:52:43.503341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:52:43.479577Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":"ca26e6c6-4d27-4c8b-907a-5a7cd1e142fe","year":2020},"citing_paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:52:42.980950Z"},"links":{"citing_paper":"/paper/2505.00315"},"observation_digest":"sha256:e8eaf7540c284830b292ecd4d2cddf47512aa8b088c10a810c252e3492308ed9","observation_id":"a5ae2b1d-17f2-4fc4-b392-5bc6efd3458e","resolution":{"observed_at":"2026-08-16T04:52:43.486226Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00315","last_updated":"2025-05-01T05:22:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:19:25.080908Z","submitted_at":"2025-05-01T05:22:11Z","title":"Mixture of Sparse Attention: Content-Based Learnable Sparse Attention via Expert-Choice Routing"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 5 inbound Pith citation observations for arXiv:2505.00315."}