{"as_of":"2026-08-18T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9ec373ad1b73d641484666884a81488cf0a888b53d6bc2a84b63003d4120102","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:20:00.523197Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:50:51.900169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:39:56.501546Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"cited_work":{"arxiv_id":"2507.08771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08771","snapshot_observed_at":"2026-07-04T15:39:56.501546Z","title":"Blockffn: Towards end-side acceleration-friendly mixture-of-experts with chunk-level activation sparsity.arXiv preprint arXiv:2507.08771, 2025","venue":null,"work_id":"a28beb10-fd4c-400b-b5c5-f9b61c7cef36","year":2025},"citing_paper":{"arxiv_id":"2605.30876","last_updated":"2026-06-20T08:46:49Z","snapshot_observed_at":"2026-08-03T23:34:59.657375Z","submitted_at":"2026-05-29T06:03:50Z","title":"dMoE: dLLMs with Learnable Block Experts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T22:50:51.900169Z"},"links":{"cited_paper":"/paper/2507.08771","citing_paper":"/paper/2605.30876"},"observation_digest":"sha256:2deed2085096fad9ddcd2f6d592b10a3a4927f823222e257ac44c10171b92ae2","observation_id":"443bc417-9566-4821-9188-faa0047dcff7","resolution":{"observed_at":"2026-06-28T22:52:45.095922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"cited_work":{"arxiv_id":"2507.08771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.08771","snapshot_observed_at":"2026-07-04T15:39:56.501546Z","title":"Blockffn: Towards end-side acceleration-friendly mixture-of-experts with chunk-level activation sparsity.arXiv preprint arXiv:2507.08771, 2025","venue":null,"work_id":"a28beb10-fd4c-400b-b5c5-f9b61c7cef36","year":2025},"citing_paper":{"arxiv_id":"2606.26287","last_updated":"2026-06-24T18:34:00Z","snapshot_observed_at":"2026-08-14T01:07:39.505987Z","submitted_at":"2026-06-24T18:34:00Z","title":"GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-26T01:32:40.435742Z"},"links":{"cited_paper":"/paper/2507.08771","citing_paper":"/paper/2606.26287"},"observation_digest":"sha256:fec4033e92288c260fc49e8fd67194db5ad2868cb651d9152372c0e36520abea","observation_id":"5527f436-88e0-4a7d-bd8e-e1decd92f1cc","resolution":{"observed_at":"2026-07-04T15:39:56.503036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.08771/citation-record","integrity":"/paper/2507.08771/integrity","json":"/paper/2507.08771/citation-record.json","paper":"/paper/2507.08771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:02.028839Z","title":"PIQA : Reasoning about physical commonsense in natural language","venue":null,"work_id":"2d61e100-b4e0-49b0-a702-8cbce1340be5","year":2020},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.116064Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:2ae2ea63b1646195ef5f966849213425abb670ff9498c84f41b99261be1d18a5","observation_id":"25fa0fb7-6e23-4bfd-8cc3-f9f36670b563","resolution":{"observed_at":"2026-08-06T18:20:02.033486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-06T18:20:00.123050Z","title":"Medusa: Simple LLM inference acceleration framework with multiple decoding heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.123050Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:c23921790aeb8cebb1d81f9bcdd7796c75ec334bd5f74673d5f225639d167cec","observation_id":"b57dedeb-ae76-41c5-b3a2-f55d69df0f44","resolution":{"observed_at":"2026-08-06T18:20:00.123050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.993375Z","title":"BoolQ : Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"1f1ec698-06bf-48ad-bf99-a462b826aa9a","year":2019},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.129099Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:3bd09c46a07a6d99e60fe721e208d53fddd775086272980be497b51af9e8bf12","observation_id":"d59b9e6c-aee0-49b5-b253-a7558066ea20","resolution":{"observed_at":"2026-08-06T18:20:02.006520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.936448Z","title":"TyDi QA : A benchmark for information-seeking question answering in typologically diverse languages","venue":null,"work_id":"52e40866-c6e1-4f33-aa5a-f651091372e8","year":2020},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.134298Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:fdab0eae8fdd8493e8e7efb046890252c053b109c46d55ebef6490e09a8acdc6","observation_id":"2d36ce6a-fa90-48ad-8658-51e69906c554","resolution":{"observed_at":"2026-08-06T18:20:01.964734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-18T13:55:31.813413Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-06T18:20:00.139543Z","title":"DeepSeekMoE : Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.139543Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:ce9d6ebabb45c67e2e00b968329ecd537467a5ba6a058a230b6bc08f35acdbc3","observation_id":"fc253894-037c-4f0e-9518-3778fdd8336b","resolution":{"observed_at":"2026-08-06T18:20:00.139543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.919271Z","title":"Language modeling with gated convolutional networks","venue":null,"work_id":"8ffe868b-3cf8-472c-a279-62012ba9d1ec","year":2017},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.147464Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:f6e16b7a843d636b549d1f5fed04c624e2511211e6634c9426c17a435edc1b70","observation_id":"b66a0274-5a9c-40fd-a5c4-936255cadfbd","resolution":{"observed_at":"2026-08-06T18:20:01.926715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-06T18:20:00.152649Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.152649Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:021e36cbf3c841efc340ed5c1f7085984ff1fcd6fc2810451ae36d1178e9e6d7","observation_id":"becf4859-0d6b-47cb-a1c7-33fad50d7330","resolution":{"observed_at":"2026-08-06T18:20:00.152649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:20:00.158485Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.158485Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:400797b94f348779d1e1802f1ccb31e8376a07b1de72f5abe1639cd21e92b41c","observation_id":"086fbc5d-070c-4a7f-97f1-51f4fe6b4ca0","resolution":{"observed_at":"2026-08-06T18:20:00.158485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.892478Z","title":"Switch Transformers : Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"f2abfbed-958d-45f9-b2a4-f93612d06091","year":2022},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.162672Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:bdb8fe043d70ed1c5eeecc82089cce4c34216545102a67510dc5c0da6b29a55b","observation_id":"20c700f7-2af5-4d32-9a65-1da0ef4ef76f","resolution":{"observed_at":"2026-08-06T18:20:01.905046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.871600Z","title":"SparseGPT : Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"dac8bceb-5109-4d28-ae41-8b468f7a1dd7","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.167176Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:8ee131e287bea002fbb0a49c8eb65ace380ab2896d17de83d4f2ecb8d51e9973","observation_id":"8dd14c3c-02c3-43d8-a52c-63e68d5035e8","resolution":{"observed_at":"2026-08-06T18:20:01.877043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.846846Z","title":"MegaBlocks : Efficient sparse training with mixture-of-experts","venue":null,"work_id":"c2b57b52-473d-4855-8e52-9e5fb5e1df9e","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.172323Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:8f30728ecad540cbc45e57cf27327b605ade103584980f34909485616684ec77","observation_id":"9883f86a-5a9f-4832-bfc4-db0bda45f159","resolution":{"observed_at":"2026-08-06T18:20:01.851894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-06T18:20:00.176813Z","title":"The P ile: An 800 GB dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.176813Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:fc5a72bb99ac32765e05e0becc69762bd7e23cfa000fccec3a3c2ab074d3b717","observation_id":"709b6dab-f0d3-4921-a1af-d33a2f5ba256","resolution":{"observed_at":"2026-08-06T18:20:00.176813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-06T18:20:00.185451Z","title":"Knowledge distillation of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.185451Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:c5a6ca973c4395794b2fabbfd78791fbdfc0640d90df399aa7be61e758b3a44f","observation_id":"e61f35ce-cdea-4b3b-83f8-1e1b304a7f98","resolution":{"observed_at":"2026-08-06T18:20:00.185451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-16T18:36:37.791090Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-06T18:20:00.189812Z","title":"FastMoE : A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.189812Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:6bd7865cf0180994e02e0b642a9cd14fb27a96197d562691c9f1f8b063590013","observation_id":"8f82d564-9f3c-467a-876f-ff097377227b","resolution":{"observed_at":"2026-08-06T18:20:00.189812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-08-17T13:50:40.586963Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-06T18:20:00.195091Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.195091Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:575c035566cad08a865840d5ff90e1fd1d5032149b360b3f4ca1d29849869d18","observation_id":"4885e582-1654-482f-ba39-538194b9bca2","resolution":{"observed_at":"2026-08-06T18:20:00.195091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T18:20:00.199417Z","title":"MiniCPM : Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.199417Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:72a7bd278f25f47ef8280a0faf1f58c75d2ddc4589a79d418d0e62eb62f5fb4b","observation_id":"c560bb00-3ef7-4756-a726-d4c3e909313b","resolution":{"observed_at":"2026-08-06T18:20:00.199417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:00.204257Z","title":"Harder tasks need more experts: Dynamic routing in MoE models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.204257Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:e4a4e463c625da41077794424a46541482927e4d981d9ea7cc01b50fd5fd919a","observation_id":"e4a7d469-e966-483b-81f5-98417631cdf9","resolution":{"observed_at":"2026-08-06T18:20:00.204257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.829695Z","title":"Tutel: Adaptive mixture-of-experts at scale","venue":null,"work_id":"fe656e8d-756b-4331-b071-4ef09c92202c","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.208679Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:48b8f8fd58b8bda883c27b61ca8c58b263e01093cc94a8a579c18cbc77c1ea19","observation_id":"58fe1ec6-c0e1-40e4-9fae-4a7ee2be6c00","resolution":{"observed_at":"2026-08-06T18:20:01.834840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T18:20:00.213261Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.213261Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:9d69608b305ef75b1b043d7252e4ef373d6f8e9cff5e56036f027c59d3d54f91","observation_id":"1b3dc5d7-1be0-492d-8bb4-a90ea8d92b04","resolution":{"observed_at":"2026-08-06T18:20:00.213261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-18T12:11:18.333774Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-06T18:20:00.225860Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.225860Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:218cd88207addcdcc0675acffde18a85c43c0c1f77acf4b6d51426349d3a8476","observation_id":"7060e794-53d6-4614-9403-522dba46b907","resolution":{"observed_at":"2026-08-06T18:20:00.225860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.813449Z","title":"Fast inference from Transformers via speculative decoding","venue":null,"work_id":"00211139-d45e-49ad-8715-4b4b1e9c2ac7","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.235002Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:8d03965b1e6a029159ad0c8aeaacff3b65cc5b57c452b7e24e169f30ccd3fed6","observation_id":"e2e6cce0-03e7-4d88-9e45-03f35124285f","resolution":{"observed_at":"2026-08-06T18:20:01.818992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-06T18:20:00.239663Z","title":"StarCoder : may the source be with you! arXiv preprint arXiv:2305.06161, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.239663Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:0e2eb6e518245a7aa8cc16984ded49b619f19e00dcb1d8cbb5721307a09623c4","observation_id":"a0488d49-b902-4415-a79d-6c3bb7b0083d","resolution":{"observed_at":"2026-08-06T18:20:00.239663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-06T18:20:00.246316Z","title":"EAGLE : Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.246316Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:8152aabfefe6ce8ed27d8f47eaa171759b86ba1d6e5c10d89229a5cbbab43c0e","observation_id":"516aafb3-7494-4d74-b9cd-4b1998290d42","resolution":{"observed_at":"2026-08-06T18:20:00.246316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.794874Z","title":"EAGLE-2 : Faster inference of language models with dynamic draft trees","venue":null,"work_id":"a48d892e-03a8-41c3-978a-b90b739d9323","year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.265331Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:a6f7bcfa8ceae215c6af6dc5ab7f9a2bc56caa3053474e7ae6f93e41c06b4ec0","observation_id":"c78072f2-a450-4ca3-9f8a-8033e5a7460d","resolution":{"observed_at":"2026-08-06T18:20:01.800258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.780626Z","title":"The lazy neuron phenomenon: On emergence of activation sparsity in Transformers","venue":null,"work_id":"a852fc97-7d43-4831-92b4-f9129644bb22","year":2022},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.280965Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:c2572012d6003c907cadd54fe19f36aee683dd44b81437e373c0d763778e113f","observation_id":"d03b74b2-0cf4-4847-bd92-31c8cb1afab9","resolution":{"observed_at":"2026-08-06T18:20:01.785310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T18:20:00.291096Z","title":"DeepSeek-V2 : A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.291096Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:f46cc156997ca66ea21d1f7692d6c47898b281561385463e93c7e4fa729e8c54","observation_id":"f4f91eca-3bb6-465d-aeff-540963d4cddc","resolution":{"observed_at":"2026-08-06T18:20:00.291096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T18:20:00.296637Z","title":"DeepSeek-V3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.296637Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:db4ade42328537f16cf0ce8fa5107cbbca00ab850aff260b1151fd2f0db6f0e4","observation_id":"e398f203-85dc-44a6-81fa-8cc2a9e7ff9a","resolution":{"observed_at":"2026-08-06T18:20:00.296637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12136","last_updated":"2024-09-18T17:00:20Z","snapshot_observed_at":"2026-08-16T13:17:26.007113Z","submitted_at":"2024-09-18T17:00:20Z","title":"GRIN: GRadient-INformed MoE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12136","snapshot_observed_at":"2026-08-06T18:20:00.301919Z","title":"GRIN : Gradient-informed MoE","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.301919Z"},"links":{"cited_paper":"/paper/2409.12136","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:465b7bb2ac12241e6be590452833130968e97bc74771b431049f1d087b691e73","observation_id":"47be00ea-9acd-4eb0-a587-56d76c9d458e","resolution":{"observed_at":"2026-08-06T18:20:00.301919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.765061Z","title":"Deja Vu : Contextual sparsity for efficient LLMs at inference time","venue":null,"work_id":"ea90d6e5-99c8-485c-8ea0-782bdd09052e","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.307176Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:912243b17b5b83305be7a7ebb8beae27108978aa038844ddde2b9b2662fc2b5f","observation_id":"e7468f16-caaa-4d13-a243-fb27d8bae376","resolution":{"observed_at":"2026-08-06T18:20:01.771121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02335","last_updated":"2025-06-30T09:50:52Z","snapshot_observed_at":"2026-08-18T12:37:42.364458Z","submitted_at":"2024-11-04T17:59:04Z","title":"Sparsing Law: Towards Large Language Models with Greater Activation Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02335","snapshot_observed_at":"2026-08-06T18:20:00.312851Z","title":"S parsing L aw: Towards large language models with greater activation sparsity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.312851Z"},"links":{"cited_paper":"/paper/2411.02335","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:378ba04171d90c1746a38081a646f1b8350863365da7b1497990f340e50a0716","observation_id":"72eb8b80-925b-4b3b-8508-d59bd534c81f","resolution":{"observed_at":"2026-08-06T18:20:00.312851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11627","last_updated":"2023-09-28T03:59:27Z","snapshot_observed_at":"2026-08-16T15:31:43.348408Z","submitted_at":"2023-05-19T12:10:53Z","title":"LLM-Pruner: On the Structural Pruning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11627","snapshot_observed_at":"2026-08-06T18:20:00.319815Z","title":"LLM-Pruner : On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.319815Z"},"links":{"cited_paper":"/paper/2305.11627","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:43a8dd2b2d790fa37c2ed1841986aae0456d676bed84ddc824224790ae898c82","observation_id":"2e3d2b29-e9fa-4350-8b6a-64625e583a2e","resolution":{"observed_at":"2026-08-06T18:20:00.319815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-18T15:21:15.975406Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-06T18:20:00.326711Z","title":"ReLU strikes back: Exploiting activation sparsity in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.326711Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:1b7ae280a5204dd4742022fcca20f2576783c0c97d7b1bba6db4ff800f7838cd","observation_id":"d7dd08c2-2153-43ea-a3d4-cf8960f2ad0a","resolution":{"observed_at":"2026-08-06T18:20:00.326711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03745","last_updated":"2024-05-13T16:20:29Z","snapshot_observed_at":"2026-08-16T15:26:08.420515Z","submitted_at":"2023-06-06T15:04:31Z","title":"Soft Merging of Experts with Adaptive Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03745","snapshot_observed_at":"2026-08-06T18:20:00.332298Z","title":"Soft merging of experts with adaptive routing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.332298Z"},"links":{"cited_paper":"/paper/2306.03745","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:3d8dd02952d1f4997665d6ed2500cdeef2bbe26fe7e4d3ee3e57b6a81d67deae","observation_id":"1c792a5f-a297-4f88-a602-aff13ae896e4","resolution":{"observed_at":"2026-08-06T18:20:00.332298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.749803Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"6b01a3c7-3031-40c1-bd7e-1316997e78b2","year":2016},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.337510Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:00b05371d7fc14fb3393f35de4f8fc1c6cf3a53862861cc300a09c0ff9e827c1","observation_id":"849baa19-38b4-4075-bc2a-937cad948e88","resolution":{"observed_at":"2026-08-06T18:20:01.755957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.734829Z","title":"Exploring the limits of transfer learning with a unified text-to-text Transformer","venue":null,"work_id":"081aaecb-ebbf-413a-b9b3-ab40a0e2738d","year":2020},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.343231Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:e8b2ed92cfd1df09337d96f1c3316da0bf7779de1c89b57b02ff3da9c0a0b01c","observation_id":"575f85a8-5179-4854-a603-839825c544cb","resolution":{"observed_at":"2026-08-06T18:20:01.739615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16014","last_updated":"2024-04-30T17:54:04Z","snapshot_observed_at":"2026-08-02T10:59:21.418230Z","submitted_at":"2024-04-24T17:47:22Z","title":"Improving Dictionary Learning with Gated Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16014","snapshot_observed_at":"2026-08-06T18:20:00.348641Z","title":"Improving dictionary learning with gated sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.348641Z"},"links":{"cited_paper":"/paper/2404.16014","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:014f6b4e215ab007b0361f0226eba4692ca8948868076a2e916ae3fb235208d9","observation_id":"fd5e66af-7322-43de-a68a-59eb8cc327b5","resolution":{"observed_at":"2026-08-06T18:20:00.348641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-06T18:20:00.353233Z","title":"Searching for activation functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.353233Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:f754c6a5e697451b18483f9625570115ef1c05e263380d908989d33acc70b481","observation_id":"7dfb9ccb-c0d2-412c-955c-cf9a429fa4c8","resolution":{"observed_at":"2026-08-06T18:20:00.353233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.716229Z","title":"SocialIQA : Commonsense reasoning about social interactions","venue":null,"work_id":"c557dddf-c087-40fb-8838-a433fab361d9","year":2019},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.358809Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:cad7d4ae69ed2371f9ab7deb28ccf94c2769a0a119cba8642e4c9ed57304ff10","observation_id":"8ad04899-f78c-420b-afd3-cc161c9d8e16","resolution":{"observed_at":"2026-08-06T18:20:01.724586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-08-16T15:05:54.961547Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-08-06T18:20:00.363844Z","title":"Omniquant: Omnidirectionally calibrated quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.363844Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:aa1e49caad396093ae8c81bc1edb3d2b3e041a52501a295e005e388d13e5e672","observation_id":"9d3363eb-a434-4907-826e-0a48c4902190","resolution":{"observed_at":"2026-08-06T18:20:00.363844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T18:20:00.369351Z","title":"GLU variants improve Transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.369351Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:271f228c71e804a158dee7ce29bf15a2d0c370cb5f2e1984f94195958959cb3e","observation_id":"a608e87e-f83b-4a60-8507-4b651100694d","resolution":{"observed_at":"2026-08-06T18:20:00.369351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-18T13:13:10.222946Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-06T18:20:00.374027Z","title":"Dolma: An open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.374027Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:26d80032f3f4d320d0059d85c6b854b0915f388466091448df64d5479e6fec1a","observation_id":"20f5ddc7-99d1-45d0-8b5b-cd3b6b779129","resolution":{"observed_at":"2026-08-06T18:20:00.374027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.693023Z","title":"P ro S parse: Introducing and enhancing intrinsic activation sparsity within large language models","venue":null,"work_id":"4afc5fa0-3b6b-4823-8e3d-ab0cd5ceb361","year":2025},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.379119Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:00bb69d8802a57328442de775956941e5c2a5a11ddc867b1c8299805ad8ee240","observation_id":"b190fc45-d9e5-4ddf-9ad9-dac4c51e70e5","resolution":{"observed_at":"2026-08-06T18:20:01.697972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-16T14:34:13.719836Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-06T18:20:00.384466Z","title":"PowerInfer : Fast large language model serving with a consumer-grade GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.384466Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:6e40f718d21baa655a78a98d96931fb1c0813cd007d105adab5cb05270c5de8b","observation_id":"0aeb7da2-92c1-4501-bf32-4b3b6ad58c68","resolution":{"observed_at":"2026-08-06T18:20:00.384466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-08-18T15:22:06.823821Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-06T18:20:00.389662Z","title":"Turbo Sparse : Achieving LLM SOTA performance with minimal activated parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.389662Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:4fee2f99ebc1e1f1f71f84cfc9f391f443582e0458c490375ce8cb9ff70b8d14","observation_id":"e03d1162-e296-44da-a76d-51bfbd2de612","resolution":{"observed_at":"2026-08-06T18:20:00.389662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-06T18:20:00.395583Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.395583Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:79c27d632fac5b8a1301c1c1051d4ba48b988c08390924679fed80168876d446","observation_id":"2649523e-6833-4eb3-ae6b-9b1de0c4042f","resolution":{"observed_at":"2026-08-06T18:20:00.395583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.677733Z","title":"CUTLASS , Jan 2023","venue":null,"work_id":"e1cf6e73-bcf4-47bd-8143-d767e849b606","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.408475Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:3ddd0baaa878f7527d05c17c0116fb39ed53d987801aa62d48113416d59401d2","observation_id":"365695a0-91c8-4964-a070-4aa6c8fbb17a","resolution":{"observed_at":"2026-08-06T18:20:01.682402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.656040Z","title":"Efficient large language models: A survey","venue":null,"work_id":"b0f1e270-612a-4102-a592-1d6aa5dcf07e","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.413752Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:05d321aa1e8a5b5b760991b2135fe974894b69cc6224e5ac040a81960f2d699d","observation_id":"aaabc245-9903-425a-a86a-2377bfe0ce71","resolution":{"observed_at":"2026-08-06T18:20:01.661552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15664","last_updated":"2024-08-28T09:31:09Z","snapshot_observed_at":"2026-08-15T04:59:51.918109Z","submitted_at":"2024-08-28T09:31:09Z","title":"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15664","snapshot_observed_at":"2026-08-06T18:20:00.418545Z","title":"Auxiliary-loss-free load balancing strategy for mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.418545Z"},"links":{"cited_paper":"/paper/2408.15664","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:4f0acf38dd53836e34b5be4f44e67a63f1cdfe7ae469ffff1cf2b3efcf452eaa","observation_id":"5e66add9-f76c-47ba-ab8f-76dc9a53554e","resolution":{"observed_at":"2026-08-06T18:20:00.418545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14711","last_updated":"2025-02-27T16:33:09Z","snapshot_observed_at":"2026-08-14T22:43:45.227916Z","submitted_at":"2024-12-19T10:21:20Z","title":"ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14711","snapshot_observed_at":"2026-08-06T18:20:00.424283Z","title":"ReMoE : Fully differentiable mixture-of-experts with ReLU routing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.424283Z"},"links":{"cited_paper":"/paper/2412.14711","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:e04c60e620e6bfa317614c844b41d99f2617d3cd75f8098a32ef3c318c90df82","observation_id":"ad462045-dcd7-40d1-8b27-cfd91c2ebd0c","resolution":{"observed_at":"2026-08-06T18:20:00.424283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02120","last_updated":"2024-06-07T02:50:56Z","snapshot_observed_at":"2026-08-16T22:22:41.448725Z","submitted_at":"2023-12-04T18:50:35Z","title":"Magicoder: Empowering Code Generation with OSS-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02120","snapshot_observed_at":"2026-08-06T18:20:00.429721Z","title":"Magicoder: Empowering code generation with OSS-Instruct","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.429721Z"},"links":{"cited_paper":"/paper/2312.02120","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:8c18faa0a7cd4504b9dbbdb410bba76cf279e982a1b602c44d63701610b2cebc","observation_id":"cece94a5-82ba-4719-b580-25b15f3b141d","resolution":{"observed_at":"2026-08-06T18:20:00.429721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.638862Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding","venue":null,"work_id":"36ea4ba7-9cce-4b80-bd08-38478df80b32","year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.434483Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:69d9fcf7e92be2a76ad76f30c50b203d4df17dc01bc1d17efb91b817e5cb823c","observation_id":"4934800a-3021-4a03-83c0-93cf3af0f586","resolution":{"observed_at":"2026-08-06T18:20:01.644295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-16T14:53:24.619970Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-06T18:20:00.442308Z","title":"Sheared LLaMA : Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.442308Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:65100d92b80fed8fbb0cf58a15495fffeb8207bc87b9305108968a0511e6bf05","observation_id":"3a1fcbb4-978f-4882-940b-574372928e36","resolution":{"observed_at":"2026-08-06T18:20:00.442308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.622355Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"553b3272-622a-4253-8c25-97d530b35cce","year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.447593Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:6cd27825a1436152e7c77110d7f232fff46b8e4bf379b1681622e07904e3d6ed","observation_id":"e4fe0660-d3de-4f05-8bcb-269058477b56","resolution":{"observed_at":"2026-08-06T18:20:01.627328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-06T18:20:00.452578Z","title":"WizardLM : Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.452578Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:82905c3686d8ecfff804cc54e850c60e1e6838d9ef5394ead0e2d52dea0d498f","observation_id":"9b26c98d-7cb2-413b-9054-b3e19303c0fa","resolution":{"observed_at":"2026-08-06T18:20:00.452578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-16T13:44:33.550467Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-06T18:20:00.457313Z","title":"PowerInfer-2 : Fast large language model inference on a smartphone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.457313Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:6e3f84876271151b9fd0d9036aeb546acfdab14bbcd127fab2599bcdae793a23","observation_id":"c3bd469b-6ec3-40fb-a33e-85f97cc595f6","resolution":{"observed_at":"2026-08-06T18:20:00.457313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-16T17:16:25.053180Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T18:20:00.461750Z","title":"Tensor programs V : Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.461750Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:1ebee66aef530462bd67a8e3aeb92e9a8007b52eefc9e15ef7141f1b1f930c62","observation_id":"a97201bc-28ae-4c43-ab1a-f42024abd097","resolution":{"observed_at":"2026-08-06T18:20:00.461750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08302","last_updated":"2023-05-26T00:17:06Z","snapshot_observed_at":"2026-08-16T15:48:09.692405Z","submitted_at":"2023-03-15T01:27:15Z","title":"ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08302","snapshot_observed_at":"2026-08-06T18:20:00.467026Z","title":"A comprehensive study on post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.467026Z"},"links":{"cited_paper":"/paper/2303.08302","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:54d435303a29938292ade4c7c50b5aafc75baa1fa2d953b54c36cf0925e314c6","observation_id":"25797477-e26a-421e-9ef0-e44c03e8bedc","resolution":{"observed_at":"2026-08-06T18:20:00.467026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.598538Z","title":"HellaSwag : Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, pp.\\ 4791--4800, 2019","venue":null,"work_id":"47f33f00-62bb-40ed-a856-edaeac00814b","year":2019},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.474478Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:85d19d6716691b81427d3028c9abd322dcbbc074906abcae21c89ea524c3856e","observation_id":"a277af18-f8a9-4d11-942e-f0bcdd3958cc","resolution":{"observed_at":"2026-08-06T18:20:01.607219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.580788Z","title":"Root mean square layer normalization","venue":null,"work_id":"158eff27-be01-4cd8-85b4-4e91c77371eb","year":2019},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.479641Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:055f540c8700b381577c75cb7ff382ab48be850b53e0d668ab79af4666f0816f","observation_id":"c5e6c3cf-3197-4da6-b48a-e310b78750f1","resolution":{"observed_at":"2026-08-06T18:20:01.586515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-16T14:21:06.240224Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-08-06T18:20:00.484184Z","title":"ReLU ^2 wins: Discovering efficient activation functions for sparse LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.484184Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:907f4f4436bec5fbc53ab3ac73e382d49f2288b7f70ea8d375069062bb55b184","observation_id":"01cbe2a3-37ea-4fb4-8e35-e1dc8e9e3ef6","resolution":{"observed_at":"2026-08-06T18:20:00.484184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.563718Z","title":"Exploring the benefit of activation sparsity in pre-training","venue":null,"work_id":"c5b070dd-0a67-43b9-917d-dfbc840abd84","year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.489567Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:9a58757bbeafc838b95eec0d935102aca13d7c7dcee29498e922556f0c186610","observation_id":"c9db0349-ea9d-4d1e-b7d4-e71de08952b2","resolution":{"observed_at":"2026-08-06T18:20:01.569359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:01.544417Z","title":"Ouroboros: Generating longer drafts phrase by phrase for faster speculative decoding","venue":null,"work_id":"42945336-034d-4088-87ee-61a1d2ee7c1d","year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.494077Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:871a9a8936f36addd99a32c22e48ac8111360beee05f69480360489b84228fea","observation_id":"516e2264-3414-4840-8cbc-e056a509ae59","resolution":{"observed_at":"2026-08-06T18:20:01.552836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14856","last_updated":"2025-03-11T08:54:55Z","snapshot_observed_at":"2026-08-16T12:56:33.394680Z","submitted_at":"2025-02-20T18:58:10Z","title":"FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14856","snapshot_observed_at":"2026-08-06T18:20:00.499895Z","title":"FR-Spec : Accelerating large-vocabulary language models via frequency-ranked speculative sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.499895Z"},"links":{"cited_paper":"/paper/2502.14856","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:14b1b34126f93fdfe2aea26374215b58bd53065e036d4cc347b0849e60a2faf0","observation_id":"3d8819fc-ab7a-49f8-aae5-4dc2a5f00633","resolution":{"observed_at":"2026-08-06T18:20:00.499895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03133","last_updated":"2024-08-19T06:45:06Z","snapshot_observed_at":"2026-08-16T13:55:12.252959Z","submitted_at":"2024-05-06T03:06:33Z","title":"Lory: Fully Differentiable Mixture-of-Experts for Autoregressive Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03133","snapshot_observed_at":"2026-08-06T18:20:00.505281Z","title":"Lory: Fully differentiable mixture-of-experts for autoregressive language model pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.505281Z"},"links":{"cited_paper":"/paper/2405.03133","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:84cbece7ebb494e864e107a838b2338e78239b4bd5c9054fdbcc94a86e362b55","observation_id":"ec30a20a-b760-4d15-8bf7-5a8616bae220","resolution":{"observed_at":"2026-08-06T18:20:00.505281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:00.510593Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.510593Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:dcff53518a10ad65e98ee7f222dd7e8e97a6f45c329c708286399ed18f1106ae","observation_id":"11de79ca-38ea-4612-a47d-3447bd797cfc","resolution":{"observed_at":"2026-08-06T18:20:00.510593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:00.517604Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.517604Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:d2a565a95f2c7e3ab2b4fb4c5c6d75e451d891f4e1d7d09c06ada9072a9293bf","observation_id":"1a79635e-532f-4ff6-88bd-ab19558b5e33","resolution":{"observed_at":"2026-08-06T18:20:00.517604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:20:00.523197Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.523197Z"},"links":{"citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:fe881f64acbd04fd0dd7ec25cabf989ae7419e0290c974ffd8d43c9c7b7a61b2","observation_id":"cefe486b-021e-4a95-a1ab-6965acf4db97","resolution":{"observed_at":"2026-08-06T18:20:00.523197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T02:00:29.298537Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 2 inbound Pith citation observations for arXiv:2507.08771."}