{"as_of":"2026-08-18T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d770be3c9dd005264f001c3d1fbcaa80d597e86ce3938099e665a14d3224d34","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:24:00.873308Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T01:39:29.681621Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T03:24:12.966811Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"cited_work":{"arxiv_id":"2505.15414","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15414","snapshot_observed_at":"2026-06-30T03:24:12.966811Z","title":"Efficient data driven mixture-of-expert extraction from trained networks,","venue":null,"work_id":"a227cba1-686e-49b0-9252-0fc8142669eb","year":2025},"citing_paper":{"arxiv_id":"2606.28516","last_updated":"2026-06-26T18:12:03Z","snapshot_observed_at":"2026-08-15T14:07:27.113517Z","submitted_at":"2026-06-26T18:12:03Z","title":"CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T01:39:29.681621Z"},"links":{"cited_paper":"/paper/2505.15414","citing_paper":"/paper/2606.28516"},"observation_digest":"sha256:89f669fa4915cb0c9c66b17334a4fa227eb3c8657ba9b1995c1284c5a94be91d","observation_id":"d2073092-f490-4894-ba08-6d98b6206114","resolution":{"observed_at":"2026-06-30T03:24:12.968335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15414/citation-record","integrity":"/paper/2505.15414/integrity","json":"/paper/2505.15414/citation-record.json","paper":"/paper/2505.15414"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:06.031188Z","title":"Cnn mixture- of-depths","venue":null,"work_id":"1ee7638c-113f-44ff-a78f-4e1fe2517c02","year":2024},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.027851Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:c744e400eaa17f6a16bd8f653bd4cf0c448cd0bcd22734cf8dbdabaa31ae017f","observation_id":"13d87c56-375b-46a8-8a0d-346442c8da75","resolution":{"observed_at":"2026-08-07T15:24:06.069066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:05.958490Z","title":null,"venue":null,"work_id":"795197e7-ad5b-4cd2-a150-2cb2bf692e82","year":2013},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.062940Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:e85e858dfe505c77a1d40e66352b5b964f0f161a769d94c4531e0fc1c145a246","observation_id":"5955cf6d-ed92-42c0-96af-05ca9fa94802","resolution":{"observed_at":"2026-08-07T15:24:05.984198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:05.811680Z","title":"Adamv-moe: Adaptive multi-task vision mixture-of- experts","venue":null,"work_id":"6960883b-0ede-49a5-912d-a96e2e35a621","year":2023},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.096642Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:893783fef0d92d98601e02d5963039bf5ab6a8c103af03b09be5465e44fd6f18","observation_id":"96f4ab52-d866-4f7b-aac4-fa6b936dd4da","resolution":{"observed_at":"2026-08-07T15:24:05.917478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04354","last_updated":"2023-09-08T14:24:10Z","snapshot_observed_at":"2026-08-16T15:02:14.520616Z","submitted_at":"2023-09-08T14:24:10Z","title":"Mobile V-MoEs: Scaling Down Vision Transformers via Sparse Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04354","snapshot_observed_at":"2026-08-07T15:23:58.172551Z","title":"Daxberger, Floris Weers, Bowen Zhang, Tom Gunter, Ruoming Pang, Marcin Eichner, Michael Emmers- berger, Yinfei Yang, Alexander Toshev, and Xianzhi Du","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.172551Z"},"links":{"cited_paper":"/paper/2309.04354","citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:c7c5c1706dd6ae66ace711fb055517c6458b5b380380372a32fa3651a779d02b","observation_id":"dc4002fa-a2bd-40fc-8f01-c8a8488f97d7","resolution":{"observed_at":"2026-08-07T15:23:58.172551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:05.625668Z","title":"Editing factual knowledge in language models","venue":null,"work_id":"b7d63ffb-3b91-467a-93aa-6ce8081566ed","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.271023Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:7933d29fedf05d4d335256d6971898e5b1d7135236733c85f62c4495257781bb","observation_id":"6e5d2e1e-385e-4e1e-a60a-c4da269eb563","resolution":{"observed_at":"2026-08-07T15:24:05.709176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:58.313312Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.313312Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:70a96eef408e9191a86e3c3bfd21247c860f8df7c526b001ce24ba1878617e79","observation_id":"ccb394a9-2ec0-444e-9ff6-25bed08d6f25","resolution":{"observed_at":"2026-08-07T15:23:58.313312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:58.365441Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.365441Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:28b811201e43d85aafe3ed657bef65d03b3b9ea0b9c72ab88f7a43df0f14fd9e","observation_id":"66ace745-8c51-4312-8e1f-c16018d37124","resolution":{"observed_at":"2026-08-07T15:23:58.365441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:05.146211Z","title":"Learning factored representations in a deep mixture of ex- perts","venue":null,"work_id":"df4f0569-5f2e-43fe-9372-138b99794c83","year":2014},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.514743Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:0cdbeddb2651a7bfa5d668d153bd37f9c66f25f6f4d6c2a3ce8364f45a5476ef","observation_id":"ce600041-3fcf-4e20-ae9b-c6a3bd9c6c31","resolution":{"observed_at":"2026-08-07T15:24:05.255190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.877350Z","title":"Switch transformers: scaling to trillion parameter models with sim- ple and efficient sparsity","venue":null,"work_id":"b7e5c0c7-c5c7-4c94-bb3c-14ba0c6d31b8","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.570505Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:6ada1e911cbaf3b9377d6bc10b23c816c5134c984f5b8b5cdc5356b81ce7d28c","observation_id":"631009a8-1678-45f5-8cd9-fc1e32b6ee23","resolution":{"observed_at":"2026-08-07T15:24:05.017008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.706695Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":"95b35e5b-5cdb-4b82-8591-69d8682dad50","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.615645Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:2a52d0b4b66f405d982d21fb3b2c314d0a88af89a61b8a4bc6383629b339ea09","observation_id":"904a807d-9fad-443c-b007-efd9c1b9af11","resolution":{"observed_at":"2026-08-07T15:24:04.772928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.645084Z","title":"Paca-vit: Learning patch-to- cluster attention in vision transformers","venue":null,"work_id":"f7b2ee4e-490b-41e4-9c16-c3e98ab05c8b","year":2023},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.662240Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:ede3cfec61768a9f0d26f17a3dee09c5c74ea231e8ac28d5c95fc97299e5bbfd","observation_id":"8917cfb3-4389-420f-8abf-d3aeb1e354d5","resolution":{"observed_at":"2026-08-07T15:24:04.669288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.473828Z","title":"Jacobs, Michael I","venue":null,"work_id":"9dc22853-483a-4b46-8fbf-5ba07a1c97a5","year":1991},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.733747Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:6fc25e397d7bd1b513d7358f8b245b9e8fb22bd2d045584463abce8ce7305190","observation_id":"8964dc15-d008-444b-895d-4638759fe8cd","resolution":{"observed_at":"2026-08-07T15:24:04.563268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.408934Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"376e9158-2fef-4fa9-8118-cd284d6491c8","year":2009},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.835071Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:60d414a0e011e8d9e06160d1feff525bbb4f39066cdc184327635ddc4b10f988","observation_id":"c0cca5f0-338b-4d66-b4ab-4b96b2d64bf8","resolution":{"observed_at":"2026-08-07T15:24:04.461482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.324957Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"278d3b70-aa23-4ae2-a30d-08e7fd536b07","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.909804Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:6b96383da341756954a3989f3211435acd0b8bb9e7d1e3bfa38349ba721ae08d","observation_id":"fdbd8935-4465-4e1a-b3e0-07f5e5f785d2","resolution":{"observed_at":"2026-08-07T15:24:04.355795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14793","last_updated":"2022-10-26T15:40:24Z","snapshot_observed_at":"2026-08-16T16:20:56.182291Z","submitted_at":"2022-10-26T15:40:24Z","title":"M$^3$ViT: Mixture-of-Experts Vision Transformer for Efficient Multi-task Learning with Model-Accelerator Co-design","version":1},"cited_work":{"arxiv_id":"2210.14793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.14793","snapshot_observed_at":"2026-08-07T15:24:00.991062Z","title":"M$^3$ViT: Mixture-of-Experts Vision Transformer for Efficient Multi-task Learning with Model-Accelerator Co-design","venue":"cs.CV","work_id":"7fec0fea-e061-4f91-ae6f-6fd667f382b3","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.941561Z"},"links":{"cited_paper":"/paper/2210.14793","citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:da2ac23e09147c83424107efebf44ae8dd418c1705719859298eba3e4eabeb39","observation_id":"8d1fdac2-013a-4550-a0f4-5c03088be907","resolution":{"observed_at":"2026-08-07T15:24:01.043720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.203818Z","title":"Liang, Yiming Cui, Qifan Wang, Tong Geng, Wen- guan Wang, and Dongfang Liu","venue":null,"work_id":"4ee465d5-c626-44d8-8153-f416bcfc8545","year":2024},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.990130Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:84b8602f748a4083a6ef455034f87ef3b32aef6b3b09e51efb17f3cbd3020281","observation_id":"1257fd36-0f29-431a-919b-32b6b706072a","resolution":{"observed_at":"2026-08-07T15:24:04.249861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.122119Z","title":"Expediting large-scale vision transformer for dense predic- tion without fine-tuning","venue":null,"work_id":"9136d468-8aff-4a2b-8e4e-11de5bb559e1","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.088942Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:b9c4e7cc658ff56e6c534fbd077152484d8f96ffd604d8a6d4e92d32d7176004","observation_id":"12356daa-86e5-4abf-85e6-88b94ce3a4e5","resolution":{"observed_at":"2026-08-07T15:24:04.163106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:04.008375Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"c5d097ef-d427-448d-a028-359888dd9fe1","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.169834Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:4a33eb1d9cfd5897fe375656a044b7003c00ec5a832c085530639d3b76c5cb1d","observation_id":"378c6db7-499f-468c-8b75-a6a4797b9128","resolution":{"observed_at":"2026-08-07T15:24:04.060206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.880722Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"7fd199c1-24f3-494e-bfa5-6f1962068912","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.216226Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:9471e59e5877ee86551f322bd3589add017e288af5a54aecd1faa7f20c2765ab","observation_id":"cfeab651-0f64-484d-bf52-138c75035197","resolution":{"observed_at":"2026-08-07T15:24:03.916903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.638900Z","title":"SGDR: stochastic gradient descent with warm restarts","venue":null,"work_id":"c238f62e-7e88-49d2-9c38-8d2b1fa71dcb","year":2017},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.277499Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:04f4fcc0922533de82adbcd7e9781cade4301b6e0e74db2b77f1ed3f51defa2f","observation_id":"14c2299d-7fc3-4264-83b6-6e543c39779d","resolution":{"observed_at":"2026-08-07T15:24:03.672553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:59.331213Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.331213Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:d8dea20535de0360d958266c5308bcd23d824d9a93fafccdbf835936847d584f","observation_id":"0b6889e2-02a3-4894-84e1-f53876c982d0","resolution":{"observed_at":"2026-08-07T15:23:59.331213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.475426Z","title":"Data-free dynamic compression of cnns for tractable effi- ciency","venue":null,"work_id":"1ee24a52-4fa0-4b6d-a79f-9fc583dea9f5","year":2025},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.401092Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:873c84364f9dfb6ff222f5e81748c1b627d6678eee22f19e8e59a7c1676a609e","observation_id":"6c3a8ffd-db7a-465b-8cb4-05de588b739d","resolution":{"observed_at":"2026-08-07T15:24:03.542747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.386051Z","title":null,"venue":null,"work_id":"039be2d2-2eb1-4f05-95fe-d6d9b17d3fe3","year":2024},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.459275Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:e96ee14a3168d99c92689181cfb334c8ead298fefc616d3162e836b7bb1c4cd4","observation_id":"910002f6-248c-44df-840b-cc112a17533a","resolution":{"observed_at":"2026-08-07T15:24:03.433425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.272124Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"a96c1ceb-cf40-4cca-988f-4aa09a0f972b","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.525792Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:406f9c12ea0d38921a9c176e4107f0f7105ea0cc773b5a88d0a6b9e9ea77803d","observation_id":"1924e943-e112-456a-9d42-9089d2f203b2","resolution":{"observed_at":"2026-08-07T15:24:03.318844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-17T04:55:07.787141Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T15:23:59.618392Z","title":"Richards, Timo- thy P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.618392Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:c4a78744280d18f653f93c0974a79fcf9298842416ea549f25f9e220d09f14fa","observation_id":"93298046-c3cc-4af2-a7fa-5028a97c44bf","resolution":{"observed_at":"2026-08-07T15:23:59.618392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.184860Z","title":"Scaling vision with sparse mix- ture of experts","venue":null,"work_id":"fbe3f0c5-233f-4fea-82a8-7161b02a02d4","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.675519Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:6f10ac75b3158b12ae9dab377765a61c89a34844e73bd316d2b20b827561e4a4","observation_id":"8d4740d5-ad37-43e8-81a3-099d565a82e3","resolution":{"observed_at":"2026-08-07T15:24:03.233111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:03.044198Z","title":"Le, Geoffrey E","venue":null,"work_id":"eafe7651-93ad-4661-aa0a-5f22f3606152","year":2017},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.734470Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:9ee9581e3320beff915bbb1106e38b718dc4590c47e22a07a739eb767e79203c","observation_id":"29066870-2cf7-45e2-9ee2-4dfeaee96589","resolution":{"observed_at":"2026-08-07T15:24:03.091241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.963502Z","title":"Training data-efficient image transformers & distillation through at- tention","venue":null,"work_id":"fcff92df-bb34-4114-96da-84c08ea07c78","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.795232Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:70d863bb3547bbfb458fcf14087e271fb74fccbbba04ce28216d48f6317d248d","observation_id":"93ca7a46-5006-45ea-b77f-850162a1cd72","resolution":{"observed_at":"2026-08-07T15:24:02.997813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:59.844233Z","title":"Gomez, Łukasz Kaiser, and Il- lia Polosukhin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.844233Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:8a172ed6a39268b3516d3e322a9eb53d004ec1a63ccf3c82f7f4b0220bf4f0fe","observation_id":"4a86029b-a046-41b3-a71a-2c06788b8ef4","resolution":{"observed_at":"2026-08-07T15:23:59.844233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.784044Z","title":"Evo-vit: Slow-fast token evolution for dynamic vision transformer","venue":null,"work_id":"54a7140e-e218-4a7c-9a2c-c4390307853f","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.974509Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:93d833577b453467cbea8d4807b3e8b4ec53491cf278ac02476cf3d9ce61531a","observation_id":"a4a5c7d5-5681-4b63-93e7-4cefdb72b6e5","resolution":{"observed_at":"2026-08-07T15:24:02.847038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.671674Z","title":"Width & depth pruning for vision transform- ers","venue":null,"work_id":"f301839e-4c1b-4ea7-b9cf-3cc5a1ab4ed6","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.032714Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:ce7fd9bfb265567a0868bc6b639ce183a71c7056051031323450cbe08797efd3","observation_id":"464e8b07-e0fd-432c-8be5-2bf496bf8ce9","resolution":{"observed_at":"2026-08-07T15:24:02.716047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.541788Z","title":"MoEfication: Transformer feed-forward layers are mixtures of experts","venue":null,"work_id":"bed2e36f-be68-481e-aa7a-eb487530a7d3","year":2022},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.099921Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:8ee5d5417b53af7382eb578de179335dab581d1598a9413e04c9b9ceb1e9118e","observation_id":"46ccf3f7-4c0f-40f7-a545-e83710bc045c","resolution":{"observed_at":"2026-08-07T15:24:02.606178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.428827Z","title":"Emergent modularity in pre- trained transformers","venue":null,"work_id":"fc6048bf-f83d-4c2a-a1a2-f373cd1c18da","year":2023},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.175715Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:a27327ad774e1527d84d5bbecb4b849c48fee37d87e0dacaebaef4bdc9b70d49","observation_id":"3f4d5c2c-c54e-47ca-b10d-a5de3b9728c6","resolution":{"observed_at":"2026-08-07T15:24:02.476896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.276080Z","title":"Vision transformer pruning, 2021","venue":null,"work_id":"4bcb2cc9-b72d-4ac0-849d-31eae8226589","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.259021Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:977b821aac4ac1d1deb9aa243de9ab39ae6f0e51d35a025018ae9ce722f23119","observation_id":"4ecc2086-d3ea-4b26-92e3-d796a7e1ac49","resolution":{"observed_at":"2026-08-07T15:24:02.348371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.165005Z","title":null,"venue":null,"work_id":"6bf65945-9430-41c4-b6de-970ab623cb40","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.337829Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:25c8f2ef962285bd146acad9367dc600b44786a152067dc09ada846c7d318c75","observation_id":"3e76fd50-b792-4bb0-8f2a-d146be86147a","resolution":{"observed_at":"2026-08-07T15:24:02.223252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:02.068895Z","title":null,"venue":null,"work_id":"5c3497dc-7672-49d8-8880-7a4249883130","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.400571Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:a16466ddcffbfa31a016eac513de14d8d89cf05a62687db4442a4cc96bd006f0","observation_id":"4d79b088-41e4-4879-86f9-9e8cf99b9a26","resolution":{"observed_at":"2026-08-07T15:24:02.107505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.959090Z","title":"[32] rely on weight co-activation graphs and a manually set number of experts","venue":null,"work_id":"9aae9446-55e6-4efe-9fc1-4d57516fdea4","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.469962Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:84f2fa2eba5a4b68b0c4bf534ac64b65ea68945c1d6083314bbe27319db9a0d9","observation_id":"a314ddf4-c944-4124-9f95-dd19b142c509","resolution":{"observed_at":"2026-08-07T15:24:01.989832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.800100Z","title":"Our results on ImageNet-1k validate this design, showing performance gains in vision tasks","venue":null,"work_id":"5c98b2ef-258d-43e8-a8e2-dc6761c97c7c","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.534943Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:a7cde00815360d096f2f57020db5d0207c06707e9265913d9b3e37a9c3b4e628","observation_id":"522bc121-5af9-47d9-a820-fbe113f01fe4","resolution":{"observed_at":"2026-08-07T15:24:01.880385Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.677266Z","title":"Despite structural differences, all variants benefit from fewer MACs, reduced parameter counts and competitive final accuracies","venue":null,"work_id":"e7e6fcec-dd9e-4dd2-aab5-d090ff9f71f8","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.589673Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:f374b7a132b041d4dfa7ffdbe18eab1fa85fe701b8cda3addd48348adc0119a3","observation_id":"3b136eb2-b614-4b1f-ae4b-9a2d4acda1d6","resolution":{"observed_at":"2026-08-07T15:24:01.716240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.560238Z","title":"We compare our default method, HDBSCAN, against other density-based methods (DBSCAN, OPTICS) as well as partition-based alternatives (K-Means, BIRCH)","venue":null,"work_id":"6eb89922-c136-4182-8c83-41ada4283b9e","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.681243Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:b70b46c60064c90d31c8526adb466fc8a377e8b40d10a00225f4fbbd5e955da8","observation_id":"894ff46d-85d3-4a68-a614-7325debf04fa","resolution":{"observed_at":"2026-08-07T15:24:01.595145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.435083Z","title":"For the ex- traction strategy, we consider two methods for selecting the hidden neurons of each expert","venue":null,"work_id":"731851e0-b73a-4b38-93c2-5fb60ce6792e","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.765634Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:1122be11626c6b0cc125d0c4b69811d88ad8068f08aa16d2a874fb801b41e6b9","observation_id":"cb20b120-ee0d-45e7-810e-47765ebcac3e","resolution":{"observed_at":"2026-08-07T15:24:01.479245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.239976Z","title":null,"venue":null,"work_id":"cf48edb0-8bac-4c3c-8614-a6b22b9f3f38","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.830183Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:338c88543dd50fe20bdc043ec80b8fe58b6cac0a57b44df1bff75a8733da8f4a","observation_id":"d9f42eb1-d16b-48a4-be7b-9e98b49b916f","resolution":{"observed_at":"2026-08-07T15:24:01.344918Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:01.137541Z","title":"Notably, the earlier lay- ers do not exhibit any formed clusters, reflecting the more general feature representations in shallower layers","venue":null,"work_id":"22bc373a-666f-45ae-8c1c-ea9a0f7c348f","year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:00.873308Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:bb14e075948d13eb2e7cfd07d544e9402d1bcb2bb958ccca300b1d956f7da045","observation_id":"f8db9359-6281-4632-8542-2f31436fb03a","resolution":{"observed_at":"2026-08-07T15:24:01.184009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:59.912198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:59.912198Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:ffcba00fb50cc089e4160ac070f98e88c36ea12f57d10e89c3670fb16e996587","observation_id":"28c7a30f-8255-4b0c-b108-e1bfc14aed30","resolution":{"observed_at":"2026-08-07T15:23:59.912198Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:24:05.376472Z","title":null,"venue":null,"work_id":"1072715f-fc01-4f28-a58f-323ec27ae4d8","year":2021},"citing_paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:58.422257Z"},"links":{"citing_paper":"/paper/2505.15414"},"observation_digest":"sha256:dceb9faac5114eb3e8b05261644f103a22c74c44a0020da776eb8aa0a3b674b1","observation_id":"3e0dfc0a-34fe-44b9-a81d-761399d9620c","resolution":{"observed_at":"2026-08-07T15:24:05.475124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15414","last_updated":"2025-05-21T11:55:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T05:24:50.543549Z","submitted_at":"2025-05-21T11:55:25Z","title":"Efficient Data Driven Mixture-of-Expert Extraction from Trained Networks"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":11,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2505.15414."}