{"as_of":"2026-08-11T00:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3d8753e767f85d11a0195a4ba15c1f2fa685cfac52db5849e80ae2d174bf06b","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:23.210297Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17909/citation-record","integrity":"/paper/2505.17909/integrity","json":"/paper/2505.17909/citation-record.json","paper":"/paper/2505.17909"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.04248","last_updated":"2022-03-08T18:06:26Z","snapshot_observed_at":"2026-08-09T18:35:05.462369Z","submitted_at":"2022-03-08T18:06:26Z","title":"Dual Lottery Ticket Hypothesis","version":1},"cited_work":{"arxiv_id":"2203.04248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.04248","snapshot_observed_at":"2026-08-07T14:44:27.877526Z","title":"Dual Lottery Ticket Hypothesis","venue":"cs.LG","work_id":"fe708beb-4b68-44db-8016-c6417a4840d1","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:11.919090Z"},"links":{"cited_paper":"/paper/2203.04248","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:30b0ca01310a68e55ab54711a6e5257e2bda0e7ccffdb20c9b3a6c33f45a8578","observation_id":"66e5f206-e71b-461c-81a9-e02c56b8cf40","resolution":{"observed_at":"2026-08-07T14:44:27.957516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05136","last_updated":"2018-08-07T18:12:10Z","snapshot_observed_at":"2026-08-02T08:20:39.795411Z","submitted_at":"2017-11-14T15:02:47Z","title":"Deep Rewiring: Training very sparse deep networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05136","snapshot_observed_at":"2026-08-07T14:44:12.035710Z","title":"Deep Rewiring: Training very sparse deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.035710Z"},"links":{"cited_paper":"/paper/1711.05136","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b5b0e5d7ae44929195ce7fa121740dc32901e37dd28dbd0d3dfc3bcca7aecf74","observation_id":"5193e021-c86b-4be2-8e41-7df1064721d2","resolution":{"observed_at":"2026-08-07T14:44:12.035710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/bimj.4710230408","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Biometrical Journal","work_id":"455884a3-693e-45a8-8b24-4e50027634fd","year":1981},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.138159Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a11dc5a4841a93ba327337c76d9b2df1496a62a91b41a4f3751a7ed4bf839d05","observation_id":"09bb27e9-9ff0-450b-b125-008ed0bc1832","resolution":{"observed_at":"2026-08-07T14:44:23.514478Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09824","last_updated":"2021-12-18T02:26:38Z","snapshot_observed_at":"2026-07-06T12:20:09.242116Z","submitted_at":"2021-12-18T02:26:38Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09824","snapshot_observed_at":"2026-08-07T14:44:12.236606Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.236606Z"},"links":{"cited_paper":"/paper/2112.09824","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:73b8dc85a6b45253b4072ce58093f07beb71526859ee5182010d9fe1b9da9d57","observation_id":"75416058-9ad1-46d7-a048-191eec4ce2c3","resolution":{"observed_at":"2026-08-07T14:44:12.236606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T14:44:12.329681Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.329681Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d1f36515afc9944ed33dfb9ea33cf0ccd4bafbb4365982b4be2b5bfcd3cfc43c","observation_id":"e2e254e4-b893-42af-85eb-46e08bb5e66d","resolution":{"observed_at":"2026-08-07T14:44:12.329681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:12.426680Z","title":"Bagging predictors","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.426680Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:c533ac32f8fd6d5f89845dac68af648b1468df9516375a58a0d651ff76fc1c98","observation_id":"98e0d66b-7034-4165-84f6-fdfc12fe95fd","resolution":{"observed_at":"2026-08-07T14:44:12.426680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:12.542409Z","title":"Sparsity Made Easy – Introducing the Cerebras PyTorch Sparsity Library - Cerebras , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.542409Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:3365705a5dcb1713b67b221b951249ce318036f1b0fbc23473302e0cf1431b90","observation_id":"eb3149ad-85d8-473e-af6e-42eda8ffd709","resolution":{"observed_at":"2026-08-07T14:44:12.542409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T14:44:12.608543Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.608543Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:98feaa9ac1902ea9e9d1569320de41e8c3bcb2ca50326302650db8a8c5e22e5c","observation_id":"43462b01-4665-4a7a-8025-1233e03edb06","resolution":{"observed_at":"2026-08-07T14:44:12.608543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:44:12.707447Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.707447Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:6352b5e18d6ccd4dd669f660f27afb36aea5d230ec13d9d8339eb710adf0cb0f","observation_id":"6227da71-17c8-497e-92ae-51d6ef28cd4a","resolution":{"observed_at":"2026-08-07T14:44:12.707447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01732","last_updated":"2022-07-12T09:29:49Z","snapshot_observed_at":"2026-08-09T07:50:20.343279Z","submitted_at":"2021-02-02T20:06:47Z","title":"Truly Sparse Neural Networks at Scale","version":2},"cited_work":{"arxiv_id":"2102.01732","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.01732","snapshot_observed_at":"2026-08-07T14:44:27.638678Z","title":"Truly Sparse Neural Networks at Scale","venue":"cs.LG","work_id":"bcd15f67-0783-4e7c-a760-ba72330ad7ab","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.769776Z"},"links":{"cited_paper":"/paper/2102.01732","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:658b816e008cca47cec6476e398773ae0aa3eb7d43a09a4dcbdf4d53bd292c7c","observation_id":"347dcfd5-2bc6-4ada-994e-c4e3e02bf2c2","resolution":{"observed_at":"2026-08-07T14:44:27.740776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:12.870321Z","title":"ImageNet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.870321Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e1f46b87f53c1d2ec1c79692dbee4eda1a063bca949c9debc170848a901bbaea","observation_id":"9e422ca2-d494-4951-85de-e46cbbe87926","resolution":{"observed_at":"2026-08-07T14:44:12.870321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04840","last_updated":"2019-08-23T18:30:16Z","snapshot_observed_at":"2026-08-09T18:32:22.166893Z","submitted_at":"2019-07-10T17:40:20Z","title":"Sparse Networks from Scratch: Faster Training without Losing Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04840","snapshot_observed_at":"2026-08-07T14:44:12.949488Z","title":"Sparse Networks from Scratch: Faster Training without Losing Performance , 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:12.949488Z"},"links":{"cited_paper":"/paper/1907.04840","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ef57c80580525d1baf790b1b27370e6d9e15f80e053a70cb4587a29ecc2bc86b","observation_id":"61f28856-7849-4afc-b622-6ef12bb32ca3","resolution":{"observed_at":"2026-08-07T14:44:12.949488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:13.057748Z","title":"Dietterich","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.057748Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:cabb8096b959158c632c6f92bb3c76c353f5c745c00e8ca1287417f5cf3814b9","observation_id":"69f99ec9-8bbd-4c3e-8c1b-16e8cab6e461","resolution":{"observed_at":"2026-08-07T14:44:13.057748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11134","last_updated":"2021-07-23T14:12:42Z","snapshot_observed_at":"2026-07-06T08:39:52.703032Z","submitted_at":"2019-11-25T18:58:53Z","title":"Rigging the Lottery: Making All Tickets Winners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11134","snapshot_observed_at":"2026-08-07T14:44:13.153977Z","title":"Rigging the Lottery: Making All Tickets Winners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.153977Z"},"links":{"cited_paper":"/paper/1911.11134","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2112827fccaad5fa6e432ebc97ff45d7f0d1fb4e76ad40e6406699eab51c4706","observation_id":"732ef82f-9c5f-4133-9b06-b1c498aca163","resolution":{"observed_at":"2026-08-07T14:44:13.153977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03533","last_updated":"2022-03-16T00:14:20Z","snapshot_observed_at":"2026-08-10T02:19:03.453289Z","submitted_at":"2020-10-07T17:26:08Z","title":"Gradient Flow in Sparse Neural Networks and How Lottery Tickets Win","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03533","snapshot_observed_at":"2026-08-07T14:44:13.271860Z","title":"Gradient flow in sparse Neural Networks and how Lottery Tickets win","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.271860Z"},"links":{"cited_paper":"/paper/2010.03533","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d79daa840ed78a8c2337017bd913808029b7e744f4975541bdcb23dd40dfb8a2","observation_id":"2c4f52e5-71e6-465e-a7bf-3064e9da51b5","resolution":{"observed_at":"2026-08-07T14:44:13.271860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-10T10:13:42.613798Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-07T14:44:13.467858Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.467858Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:3ccc47c9eb8771371be5ff3427f34922ed34c985c841138f359aa774918663d7","observation_id":"cbcecc6d-9459-41bf-8d81-96545c2aba95","resolution":{"observed_at":"2026-08-07T14:44:13.467858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02757","last_updated":"2020-06-25T03:57:04Z","snapshot_observed_at":"2026-08-02T23:41:42.474354Z","submitted_at":"2019-12-05T17:48:18Z","title":"Deep Ensembles: A Loss Landscape Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02757","snapshot_observed_at":"2026-08-07T14:44:13.632238Z","title":"Deep Ensembles: A Loss Landscape Perspective , 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.632238Z"},"links":{"cited_paper":"/paper/1912.02757","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e8f8b2e9c2a631173f0055bedf13d1f8770b794cdf5f2eb7a2204b6da80e310c","observation_id":"a5ca5e0a-a4d4-4818-b051-271d96a6202d","resolution":{"observed_at":"2026-08-07T14:44:13.632238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-07T14:44:13.869088Z","title":"The Lottery Ticket Hypothesis: Training Pruned Neural Networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:13.869088Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ef60d537373b0fe03b88f9e4f4557a3163c610f4b08435d0bb4aed0086b90c39","observation_id":"bd4e18b1-ff3b-450d-99f3-c9fae7dac3cd","resolution":{"observed_at":"2026-08-07T14:44:13.869088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.079669Z","title":"A Decision-Theoretic Generalization of On-Line Learning and an Application to Boosting","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.079669Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:88752e211ac9a64b0f22162c927b43078996b72598a77df475eadbd258832f9d","observation_id":"bbcf884e-369e-42cc-912d-342783d1c755","resolution":{"observed_at":"2026-08-07T14:44:14.079669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.301408Z","title":"A Survey on Ensemble Learning for Data Stream Classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.301408Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:354604b75bdd431eccbe442fdf10be378ccd540703d75749abc89b92c403af4f","observation_id":"7894540d-135f-4d5a-94ee-2b26184e4965","resolution":{"observed_at":"2026-08-07T14:44:14.301408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10369","last_updated":"2022-06-17T14:08:00Z","snapshot_observed_at":"2026-07-06T13:23:04.941974Z","submitted_at":"2022-06-17T14:08:00Z","title":"The State of Sparse Training in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2206.10369","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.10369","snapshot_observed_at":"2026-08-07T14:44:27.313373Z","title":"The State of Sparse Training in Deep Reinforcement Learning","venue":"cs.LG","work_id":"9d7b4045-4411-4189-901b-94a7253c6164","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.421338Z"},"links":{"cited_paper":"/paper/2206.10369","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:624d2720945bb020af8dc4edc03fa79d95041f2cdf29d97261933df25515ee32","observation_id":"d249c34a-a4fd-4e4e-a578-5aff4c29bf8f","resolution":{"observed_at":"2026-08-07T14:44:27.385114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06548","last_updated":"2023-02-13T17:45:03Z","snapshot_observed_at":"2026-08-10T03:13:16.466090Z","submitted_at":"2023-02-13T17:45:03Z","title":"Automatic Noise Filtering with Dynamic Sparse Training in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2302.06548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.06548","snapshot_observed_at":"2026-08-07T14:44:27.088313Z","title":"Automatic Noise Filtering with Dynamic Sparse Training in Deep Reinforcement Learning","venue":"cs.LG","work_id":"258d90ff-7cc0-43e2-b427-e2e6e5bf28d7","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.586279Z"},"links":{"cited_paper":"/paper/2302.06548","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:3e8b1f1663544d5fcd44ac20163d5a3eeac63db5c48a9ba4520c28fbace23683","observation_id":"e0e5c620-8dcf-4eda-9a30-1a7cf1bebb03","resolution":{"observed_at":"2026-08-07T14:44:27.194418Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:14.769213Z","title":"On Calibration of Modern Neural Networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.769213Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:92c950b098b2990e249c2b9067c26ebe638fac8ef6537708871bf72ac84494f0","observation_id":"4dee6fdf-9bc8-46d0-8036-f76255f032fd","resolution":{"observed_at":"2026-08-07T14:44:14.769213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02626","last_updated":"2015-10-30T23:29:27Z","snapshot_observed_at":"2026-07-06T04:20:15.965140Z","submitted_at":"2015-06-08T19:28:43Z","title":"Learning both Weights and Connections for Efficient Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02626","snapshot_observed_at":"2026-08-07T14:44:14.934609Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:14.934609Z"},"links":{"cited_paper":"/paper/1506.02626","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7a412c89686389b1b98c6ca60c4a859abad8ce28cbc88bfdb3c061639dd63c90","observation_id":"42a12602-f844-407b-8860-81bbffcb3db0","resolution":{"observed_at":"2026-08-07T14:44:14.934609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:15.133429Z","title":"Neural Network Ensembles","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.133429Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7f637c841df25668784d4dfd686d75ac9d45e8d0e5c470d1f1cda6ad1660bbbf","observation_id":"f66e33af-f58c-45a1-8041-0852bbf8ab92","resolution":{"observed_at":"2026-08-07T14:44:15.133429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:15.312715Z","title":"The Elements of Statistical Learning","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.312715Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1447ebc61ec1377ef8bd665df16ecf786c785e027842d2a958aac72532cde387","observation_id":"1cd3eb80-6b6d-419b-88ae-a847d889d8b4","resolution":{"observed_at":"2026-08-07T14:44:15.312715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06610","last_updated":"2021-08-04T23:30:03Z","snapshot_observed_at":"2026-08-02T18:06:38.478187Z","submitted_at":"2020-10-13T18:05:13Z","title":"Training independent subnetworks for robust prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.06610","snapshot_observed_at":"2026-08-07T14:44:15.519215Z","title":"Training independent subnetworks for robust prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.519215Z"},"links":{"cited_paper":"/paper/2010.06610","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:50b63dfc51381c604966b8f343f04216a90ff95ecc5310dd13aa3547bc4dc427","observation_id":"9c6085fc-c066-4d71-b85a-31f4fb9a9c93","resolution":{"observed_at":"2026-08-07T14:44:15.519215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-07T14:44:15.623137Z","title":"Deep Residual Learning for Image Recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.623137Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:69663e4674a992a3a6a3ae451dde7e60e0b92942dfcd7a14a4c05fe2f5c25dc1","observation_id":"2784e133-3518-43e1-be50-b71a84b7b959","resolution":{"observed_at":"2026-08-07T14:44:15.623137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-09T13:36:49.416146Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-07T14:44:15.789693Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:15.789693Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:c89cc1748d422ece5e4285d3bc724d7ca5fa1dfeec4b2f8f347d6ff5bb152070","observation_id":"5773cf56-cb35-4333-baf9-842db34ad5f8","resolution":{"observed_at":"2026-08-07T14:44:15.789693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T14:44:16.005473Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.005473Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:85eca7837e1288c95762845cb054f0badf91cae00fa9399b5f94d50fc195207b","observation_id":"bbbe08d4-a64e-4431-95d0-b789630a9671","resolution":{"observed_at":"2026-08-07T14:44:16.005473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:44:16.198598Z","title":"Distilling the Knowledge in a Neural Network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.198598Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2d5ae7bb5f2ad50412ff6e9b2b641fa3e3e91807094a7759c1c2fe0ebc2f3253","observation_id":"440b9ba4-f062-466e-a86f-901ea0e1ac1c","resolution":{"observed_at":"2026-08-07T14:44:16.198598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:16.342941Z","title":"Jacobs, Michael I","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.342941Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:f80e3d45c315937fdd02b0b23ba09f65034fdc3c97641d11bdaeea40993c1367","observation_id":"b70f59c0-d8e2-4fcb-b744-7eba9775c5bd","resolution":{"observed_at":"2026-08-07T14:44:16.342941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11323","last_updated":"2023-10-31T12:01:36Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:07Z","title":"Joint Training of Deep Ensembles Fails Due to Learner Collusion","version":2},"cited_work":{"arxiv_id":"2301.11323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.11323","snapshot_observed_at":"2026-08-07T14:44:26.838872Z","title":"Joint Training of Deep Ensembles Fails Due to Learner Collusion","venue":"cs.LG","work_id":"02b09bc3-19f9-4531-8971-39820a303eb4","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.441859Z"},"links":{"cited_paper":"/paper/2301.11323","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:cd548d7824ea0b7ab50adc5cf04da89bdf48f9ae0cf36f77c06d0edc536c28db","observation_id":"dd4669ac-bfaa-477c-bfba-5cbc2f465524","resolution":{"observed_at":"2026-08-07T14:44:26.948514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:30.513499Z","title":"Mercer, Lalit R","venue":null,"work_id":"627dbc9d-8515-433e-b09f-0a0d35f861ca","year":1977},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.593230Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:28493f03ff10fc6b977a39d3325a1ad715f853e1a1165395268cb72a0d5201b8","observation_id":"f48f0d8e-226f-4f08-aa19-125d09ad7859","resolution":{"observed_at":"2026-08-07T14:44:30.585191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:44:16.753152Z","title":"Adam: A Method for Stochastic Optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.753152Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d672e46689431b15616415f587e8c78d282bdb7211edef06f02bd37e6dc2f61e","observation_id":"3127ba84-dcf5-4e3c-8d5b-c803230311a7","resolution":{"observed_at":"2026-08-07T14:44:16.753152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:30.369417Z","title":"Learning Multiple Layers of Features from Tiny Images","venue":null,"work_id":"d33b9055-e9f7-448e-9571-2e64db2c7fcb","year":2009},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:16.927446Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2b01553df5cd1bf299386096338142a3e8960b4c748dd5c11c7c3728952fa269","observation_id":"7cc5f1af-09cb-42ef-b42e-b9ff53c80b6d","resolution":{"observed_at":"2026-08-07T14:44:30.448192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:17.144681Z","title":"Kuncheva and Christopher J","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.144681Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:63c4ddb437cc3224a4db0296c26d884aba51b729cf269eaee718506ff40f91af","observation_id":"4812df5f-3a6a-4199-80cd-860853c6e09a","resolution":{"observed_at":"2026-08-07T14:44:17.144681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01474","last_updated":"2017-11-04T01:33:43Z","snapshot_observed_at":"2026-08-10T10:23:46.735207Z","submitted_at":"2016-12-05T18:54:43Z","title":"Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01474","snapshot_observed_at":"2026-08-07T14:44:17.305484Z","title":"Simple and Scalable Predictive Uncertainty Estimation using Deep Ensembles","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.305484Z"},"links":{"cited_paper":"/paper/1612.01474","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:385a494f24b4e6cdc17598347e038da82d2a601131831c50cb53f875451c630d","observation_id":"82ad0db2-4f3d-4b22-b234-b70a37b25ae9","resolution":{"observed_at":"2026-08-07T14:44:17.305484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:30.119894Z","title":null,"venue":null,"work_id":"d28b5225-036d-4de1-82ba-4aeafb3cd43f","year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.527410Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:3767e4e869e323fb7f92eaae3d5920e6251605c1a19ba19aeedfc79259de7446","observation_id":"18acd9d6-b85a-477c-9591-78e6ada56074","resolution":{"observed_at":"2026-08-07T14:44:30.228382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.890316Z","title":"Optimal Brain Damage","venue":null,"work_id":"2475067b-5a42-4663-af77-607e33741aee","year":1989},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.708917Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:6a64f5ece8ed031ac72d6b1dfa5e8e80faccbd8c5058296b561f75efd0b6e4fc","observation_id":"f78425ac-28b6-4bfb-bb44-05e5bd1f1859","resolution":{"observed_at":"2026-08-07T14:44:30.005151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02301","last_updated":"2025-01-29T13:27:37Z","snapshot_observed_at":"2026-08-10T04:18:40.858185Z","submitted_at":"2024-08-05T08:23:59Z","title":"Network Fission Ensembles for Low-Cost Self-Ensembles","version":2},"cited_work":{"arxiv_id":"2408.02301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02301","snapshot_observed_at":"2026-08-07T14:44:26.643444Z","title":"Network Fission Ensembles for Low-Cost Self-Ensembles","venue":"cs.CV","work_id":"466dac24-0cdd-45da-9a2e-0552b37db644","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:17.858613Z"},"links":{"cited_paper":"/paper/2408.02301","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:562ed5603991eb2cbe232cf8f3944077be39eaa0c7bca25818a79975f2addec1","observation_id":"4f89ff15-487a-4116-a9b3-3584301ab336","resolution":{"observed_at":"2026-08-07T14:44:26.730470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02340","last_updated":"2019-02-23T07:45:29Z","snapshot_observed_at":"2026-07-06T07:06:10.289386Z","submitted_at":"2018-10-04T17:39:58Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02340","snapshot_observed_at":"2026-08-07T14:44:18.076914Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.076914Z"},"links":{"cited_paper":"/paper/1810.02340","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:023e5ce513b54413b17294598f570381a445e74c79eeb29ec2552bc3c828bf70","observation_id":"edcfffd4-7652-4500-a4df-1d99501792d5","resolution":{"observed_at":"2026-08-07T14:44:18.076914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06314","last_updated":"2015-11-19T19:19:58Z","snapshot_observed_at":"2026-07-06T04:37:08.670695Z","submitted_at":"2015-11-19T19:19:58Z","title":"Why M Heads are Better than One: Training a Diverse Ensemble of Deep Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06314","snapshot_observed_at":"2026-08-07T14:44:18.243783Z","title":"Why M Heads are Better than One: Training a Diverse Ensemble of Deep Networks , 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.243783Z"},"links":{"cited_paper":"/paper/1511.06314","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:13590a2d70403e320b6f7078d70334981b7e8c64b8028494291f44a2cf4c2b62","observation_id":"0a0d4d28-85d6-4100-b22f-bb196873f680","resolution":{"observed_at":"2026-08-07T14:44:18.243783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13795","last_updated":"2025-08-04T10:49:54Z","snapshot_observed_at":"2026-08-05T13:37:28.213031Z","submitted_at":"2024-12-18T12:39:53Z","title":"Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13795","snapshot_observed_at":"2026-08-07T14:44:18.461312Z","title":"Mix-LN: Unleashing the Power of Deeper Layers by Combining Pre-LN and Post-LN","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.461312Z"},"links":{"cited_paper":"/paper/2412.13795","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e91221ea0b4bb8a64285e09dbf101a0a14dd05b08e444f2779650564defc8400","observation_id":"6ce60a9a-7ba9-4126-bdf4-772657ddd940","resolution":{"observed_at":"2026-08-07T14:44:18.461312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00521-020-05136-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:03:40.895421Z","title":"Sparse evolutionary deep learning with over one million artificial neurons on commodity hardware","venue":"Neural Computing and Applications","work_id":"da50dc60-1e2d-46a3-a7ee-63b70bca2e67","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.616644Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:db48ff5fa2599b803bd5c63cf69c99190270566a3694e79bfc70baede114e133","observation_id":"719d0591-8ec3-4721-8e02-4c0ffccc76ad","resolution":{"observed_at":"2026-08-07T14:44:23.355126Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.02887","last_updated":"2021-06-15T05:01:46Z","snapshot_observed_at":"2026-08-09T01:40:03.333336Z","submitted_at":"2021-02-04T20:59:31Z","title":"Do We Actually Need Dense Over-Parameterization? In-Time Over-Parameterization in Sparse Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.02887","snapshot_observed_at":"2026-08-07T14:44:18.767822Z","title":"Do We Actually Need Dense Over-Parameterization? In-Time Over-Parameterization in Sparse Training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.767822Z"},"links":{"cited_paper":"/paper/2102.02887","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:29975a02d80c090f46f37ade1f25e0917aef4e8e2c65433251520ee45a7d3713","observation_id":"82285b37-8be4-4244-a883-9675835242b6","resolution":{"observed_at":"2026-08-07T14:44:18.767822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:18.984031Z","title":"Deep Ensembling with No Overhead for either Training or Testing: The All-Round Blessings of Dynamic Sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:18.984031Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:dd64ffb56325b596ba9f1557221f11a9a85910bdbb19330863222fc027649860","observation_id":"9685a34b-eabb-4197-afc9-2b1f044cc95f","resolution":{"observed_at":"2026-08-07T14:44:18.984031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02643","last_updated":"2022-02-05T21:19:41Z","snapshot_observed_at":"2026-07-06T12:34:47.800121Z","submitted_at":"2022-02-05T21:19:41Z","title":"The Unreasonable Effectiveness of Random Pruning: Return of the Most Naive Baseline for Sparse Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02643","snapshot_observed_at":"2026-08-07T14:44:19.129246Z","title":"The Unreasonable Effectiveness of Random Pruning: Return of the Most Naive Baseline for Sparse Training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.129246Z"},"links":{"cited_paper":"/paper/2202.02643","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7a0c1e1917bdf5deea6ecc8939cda16d5bac1d420afa68ab3d1f5bd9b518be67","observation_id":"1fa92b7c-f112-4c2e-b429-afe41b7667f2","resolution":{"observed_at":"2026-08-07T14:44:19.129246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1106.0257","last_updated":"2011-06-01T16:41:44Z","snapshot_observed_at":"2026-08-07T11:52:49.941920Z","submitted_at":"2011-06-01T16:41:44Z","title":"Popular Ensemble Methods: An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1106.0257","snapshot_observed_at":"2026-08-07T14:44:19.344085Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.344085Z"},"links":{"cited_paper":"/paper/1106.0257","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2066d8e0a291d5fb18c0dbb0398f8fc71ce9909e5dabdb523728cbd5980049c7","observation_id":"e4ce0165-5ab5-462f-b501-107392af1db9","resolution":{"observed_at":"2026-08-07T14:44:19.344085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T14:44:19.547695Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering , 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.547695Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:2bf8c8061b1ee5c7d2670afaade3e3fe2f6e5b28576665c71cb6cd76c971d42b","observation_id":"8cb67157-9dc8-4e13-a181-cd6a2d42a304","resolution":{"observed_at":"2026-08-07T14:44:19.547695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04780","last_updated":"2018-06-20T12:55:55Z","snapshot_observed_at":"2026-07-06T05:51:15.659938Z","submitted_at":"2017-07-15T19:46:25Z","title":"Scalable Training of Artificial Neural Networks with Adaptive Sparse Connectivity inspired by Network Science","version":2},"cited_work":{"arxiv_id":"1707.04780","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.04780","snapshot_observed_at":"2026-08-07T14:44:26.244350Z","title":"Scalable Training of Artificial Neural Networks with Adaptive Sparse Connectivity inspired by Network Science","venue":"cs.NE","work_id":"4811a325-63ee-4054-9985-80d47717af4f","year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.713861Z"},"links":{"cited_paper":"/paper/1707.04780","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:aa3913192ade2f9ab21b46a56e0670a2cafd712df02a6625b02bb5bb3d2a00f1","observation_id":"cd903a2c-20b0-4ab3-9c75-284ac6f5eb59","resolution":{"observed_at":"2026-08-07T14:44:26.358926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.660098Z","title":"Skeletonization: A Technique for Trimming the Fat from a Network via Relevance Assessment","venue":null,"work_id":"f5f2db56-0539-446b-bc55-6e83e8cd6616","year":1988},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:19.933039Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:784b42c8d8ade3e17156a4ca0f52516aa47709f71d067dcd1d6e353308d50339","observation_id":"1895e05d-c12e-4813-8d2b-1f52d7a9badb","resolution":{"observed_at":"2026-08-07T14:44:29.769200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:20.071092Z","title":"Obtaining Well Calibrated Probabilities Using Bayesian Binning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.071092Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:972792e415b1ac27ff3eebb1bf76fa894d2dcaef7397f132bf006519bed1d6e8","observation_id":"330b8e86-c430-4f92-90ff-734bb8247042","resolution":{"observed_at":"2026-08-07T14:44:20.071092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.387185Z","title":"DeepSparse Inference Engine , 2021","venue":null,"work_id":"73fb346d-029b-49f6-bd2c-4e4ef94ddc68","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.175525Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:4f347266217122e5856155587959094e89f9f3e6adeeaab053052c671099d8e4","observation_id":"e994418e-410d-4d81-b697-afa0f2d65c6b","resolution":{"observed_at":"2026-08-07T14:44:29.514942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12230","last_updated":"2023-11-30T03:44:26Z","snapshot_observed_at":"2026-07-06T15:45:06.154616Z","submitted_at":"2023-06-21T12:43:55Z","title":"Fantastic Weights and How to Find Them: Where to Prune in Dynamic Sparse Training","version":2},"cited_work":{"arxiv_id":"2306.12230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.12230","snapshot_observed_at":"2026-08-07T14:44:25.934585Z","title":"Fantastic Weights and How to Find Them: Where to Prune in Dynamic Sparse Training","venue":"cs.LG","work_id":"199e08b4-c0d5-4e8f-a88f-b7a7c1438350","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.325435Z"},"links":{"cited_paper":"/paper/2306.12230","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:8e67574d543946f96d3eabdcf8281c462d57f9fe88f7a86c4046d808e7d73b60","observation_id":"1e3ca92d-eb0d-4d54-a43e-d547ff981e2a","resolution":{"observed_at":"2026-08-07T14:44:26.091130Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01755","last_updated":"2024-06-03T19:44:47Z","snapshot_observed_at":"2026-08-05T23:24:43.516263Z","submitted_at":"2024-06-03T19:44:47Z","title":"Sparser, Better, Deeper, Stronger: Improving Sparse Training with Exact Orthogonal Initialization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01755","snapshot_observed_at":"2026-08-07T14:44:20.425205Z","title":"Nowak, ukasz Gniecki, Filip Szatkowski, and Jacek Tabor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.425205Z"},"links":{"cited_paper":"/paper/2406.01755","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9b9cacae68870bf16551971d7300c9c7b8c3b7abe13538ec65071f3488785c96","observation_id":"8428e4be-13b1-422d-a74d-97c567c7e979","resolution":{"observed_at":"2026-08-07T14:44:20.425205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:29.090579Z","title":"ResNet50 v1.5 for PyTorch , 2024","venue":null,"work_id":"4b65c27f-56f0-49ad-add1-b295af15ba4f","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.561166Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:5f49325049518118176fb361436a60f10a20fe7ad63eeb0e27a52e0c47301362","observation_id":"dedd5263-4b20-4db2-a735-4dbd747ce3d0","resolution":{"observed_at":"2026-08-07T14:44:29.252939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.893303Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":null,"work_id":"fd9cea35-030d-4841-bc7d-5e8059cd7482","year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.688213Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9b6841a3f647cc540849b2ad447a8bc058d080977fa798883ae107d361cd5407","observation_id":"597bad49-07e9-4373-9c4d-c407433fb53c","resolution":{"observed_at":"2026-08-07T14:44:29.008177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.706353Z","title":"A Stochastic Approximation Method","venue":null,"work_id":"0a2edc7b-6478-4450-ab79-d7c0cb4f12f8","year":1951},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:20.851505Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:885d3330d438b05fc33e23e61230178559019a201112808eb93af1e61c7cabe0","observation_id":"af4eac31-2d55-4676-85d0-3698fcd72da4","resolution":{"observed_at":"2026-08-07T14:44:28.779551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-07T14:44:21.016796Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.016796Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d0317abfab5793ae532616f3d0a4dcb6df66f2d27d9229265e4b73e31a6d5f21","observation_id":"3d6e95a8-339c-4426-bc5a-d7d834dce895","resolution":{"observed_at":"2026-08-07T14:44:21.016796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03725","last_updated":"2023-06-06T14:44:52Z","snapshot_observed_at":"2026-07-06T15:39:14.565475Z","submitted_at":"2023-06-06T14:44:52Z","title":"Towards Memory-Efficient Training for Extremely Large Output Spaces -- Learning with 500k Labels on a Single Commodity GPU","version":1},"cited_work":{"arxiv_id":"2306.03725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03725","snapshot_observed_at":"2026-08-07T14:44:25.661475Z","title":"Towards Memory-Efficient Training for Extremely Large Output Spaces -- Learning with 500k Labels on a Single Commodity GPU","venue":"cs.LG","work_id":"999df040-da5a-4b05-b6f0-6d1d39c1eb01","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.148630Z"},"links":{"cited_paper":"/paper/2306.03725","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:ef7c2a5c4207ff861e898b1f3608b9c638026e426e8f668d31658c56150f92a6","observation_id":"9561ad24-354f-4081-a9a5-d15494df3ebf","resolution":{"observed_at":"2026-08-07T14:44:25.765932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.465042Z","title":null,"venue":null,"work_id":"7022b3bf-f53e-4984-83f9-0f5e8dac1376","year":1996},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.235606Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:1056f2ba0971ce47345e8cb2ab9e9cc834f3d7016f59ab042c5b00d8b18796eb","observation_id":"193ae81e-bd38-44a9-87b4-7858a2e693b8","resolution":{"observed_at":"2026-08-07T14:44:28.574747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04217","last_updated":"2022-05-05T18:37:44Z","snapshot_observed_at":"2026-07-06T11:17:02.238931Z","submitted_at":"2021-06-08T09:57:20Z","title":"Dynamic Sparse Training for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2106.04217","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04217","snapshot_observed_at":"2026-08-07T14:44:25.391582Z","title":"Dynamic Sparse Training for Deep Reinforcement Learning","venue":"cs.LG","work_id":"9bf7a463-82e8-4e8a-ac10-38df39c00026","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.282780Z"},"links":{"cited_paper":"/paper/2106.04217","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:0fc0e8b43a35a984f4bb35ca1e41673e6d1a72c244efdec3a1f5a19201379473","observation_id":"aeb0dcd4-9a5e-4e31-ab05-4bde6923adfc","resolution":{"observed_at":"2026-08-07T14:44:25.537900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15043","last_updated":"2023-03-08T08:47:23Z","snapshot_observed_at":"2026-07-06T13:15:24.934829Z","submitted_at":"2022-05-30T12:18:43Z","title":"RLx2: Training a Sparse Deep Reinforcement Learning Model from Scratch","version":2},"cited_work":{"arxiv_id":"2205.15043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.15043","snapshot_observed_at":"2026-08-07T14:44:25.041486Z","title":"RLx2: Training a Sparse Deep Reinforcement Learning Model from Scratch","venue":"cs.LG","work_id":"0db84869-c97e-4816-9fe2-6903efed8450","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.344571Z"},"links":{"cited_paper":"/paper/2205.15043","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d31b744b8e11e670f0bb0436ccd1629f82d2caf668108b6c213f2530467a7042","observation_id":"082ecf70-70a8-4bef-9b68-6c286d644f3d","resolution":{"observed_at":"2026-08-07T14:44:25.215575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:44:21.435141Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.435141Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:7f595f52aa54af44c0f9899ed472dd7eb21b5f326fddd2a29cabb2a709aec9fc","observation_id":"a06df54a-89cd-4602-842e-7f92ec4b5a76","resolution":{"observed_at":"2026-08-07T14:44:21.435141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0442.35604","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:24.802910Z","title":"Varrette, H","venue":null,"work_id":"030461da-220e-4949-b1cf-13e68fad5aa8","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.512080Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b54fb492888be67142a07920c4e2d5aa867acb4d76104e852d8b5ed8402c8170","observation_id":"ecf70624-3590-4484-9d8e-9ebc63156483","resolution":{"observed_at":"2026-08-07T14:44:24.896840Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:44:21.615136Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.615136Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:44ec81f043dca04193f1ce4a7c83875f2c60577ea8c90b1b4dda5af0a3af8cf2","observation_id":"5ecbf571-2046-4e99-b746-fac13ed7595b","resolution":{"observed_at":"2026-08-07T14:44:21.615136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-10T04:53:00.900945Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-07T14:44:21.715735Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.715735Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:9828fe2028baf89cca741f4f5b411e9bc8d913d360963b92c4b240d0fd986b87","observation_id":"609ad148-c3bc-42f5-9ba5-dd3c5f57f4aa","resolution":{"observed_at":"2026-08-07T14:44:21.715735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.274458Z","title":"Learning Robust Global Representations by Penalizing Local Predictive Power","venue":null,"work_id":"d11ec66d-d7ef-4977-a5ee-8ce06fb7cdad","year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.820170Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:8e71744edbe97d5ca365427c6abcc617b5040a50b0e3aff98df5236a99f92adb","observation_id":"7b458f2c-16c2-49af-baee-fd168ae858dc","resolution":{"observed_at":"2026-08-07T14:44:28.359765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06715","last_updated":"2020-02-20T03:38:44Z","snapshot_observed_at":"2026-08-01T10:08:45.076962Z","submitted_at":"2020-02-17T00:00:59Z","title":"BatchEnsemble: An Alternative Approach to Efficient Ensemble and Lifelong Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06715","snapshot_observed_at":"2026-08-07T14:44:21.931636Z","title":"BatchEnsemble: An Alternative Approach to Efficient Ensemble and Lifelong Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:21.931636Z"},"links":{"cited_paper":"/paper/2002.06715","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:f744d1ecff1677775c3a66f4cfb06674de2fb5f55f09b65dd494a0cbb8f6aff3","observation_id":"254e1cb9-0974-45c5-9563-18fcb67add63","resolution":{"observed_at":"2026-08-07T14:44:21.931636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17437","last_updated":"2024-07-24T17:13:31Z","snapshot_observed_at":"2026-08-10T11:23:11.733410Z","submitted_at":"2024-07-24T17:13:31Z","title":"Nerva: a Truly Sparse Implementation of Neural Networks","version":1},"cited_work":{"arxiv_id":"2407.17437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17437","snapshot_observed_at":"2026-08-07T14:44:24.527559Z","title":"Nerva: a Truly Sparse Implementation of Neural Networks","venue":"cs.LG","work_id":"21f9be36-0d8d-47e7-93f3-ed056e099379","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.019881Z"},"links":{"cited_paper":"/paper/2407.17437","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e9c1d378ff5ba8757db45440032a6bdc6044ba1a0c8065c0badde2827dc7a8a9","observation_id":"7a0f6a7e-ca27-44cb-bf6b-4861c2f88367","resolution":{"observed_at":"2026-08-07T14:44:24.632843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11782","last_updated":"2022-03-25T17:15:40Z","snapshot_observed_at":"2026-07-06T12:41:03.022395Z","submitted_at":"2022-02-23T20:53:54Z","title":"Prune and Tune Ensembles: Low-Cost Ensemble Learning With Sparse Independent Subnetworks","version":2},"cited_work":{"arxiv_id":"2202.11782","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.11782","snapshot_observed_at":"2026-08-07T14:44:24.313384Z","title":"Prune and Tune Ensembles: Low-Cost Ensemble Learning With Sparse Independent Subnetworks","venue":"cs.LG","work_id":"f35f4759-d940-4185-b15b-07ff22cfa5d5","year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.092097Z"},"links":{"cited_paper":"/paper/2202.11782","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:256bfa3585c8c1c4e531952a0be1e3a8cd1864e62d431293c90b4278015e46bd","observation_id":"80af6930-0542-4929-9201-1fa2278a87c8","resolution":{"observed_at":"2026-08-07T14:44:24.414672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-07T14:44:22.165258Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.165258Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:6fee877926c1d64f19fbbac21c3d05c9951a24d534bfd1041ad8cb854cf48cb8","observation_id":"a24298ac-d6d7-44a8-8833-586e4296502e","resolution":{"observed_at":"2026-08-07T14:44:22.165258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:28.101185Z","title":null,"venue":null,"work_id":"76376de9-53f3-4b98-b9f2-613d9151b989","year":1992},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.237158Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a632c49cdf4b33573cf737c39a559aa53bd6fc02a12bd2f00ff0579ee0be36b4","observation_id":"7ee3a99d-23ef-40d2-b382-84c99634a2f6","resolution":{"observed_at":"2026-08-07T14:44:28.200572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03030","last_updated":"2025-03-05T04:37:07Z","snapshot_observed_at":"2026-08-09T21:55:57.056988Z","submitted_at":"2024-10-03T22:24:54Z","title":"Dynamic Sparse Training versus Dense Training: The Unexpected Winner in Image Corruption Robustness","version":2},"cited_work":{"arxiv_id":"2410.03030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03030","snapshot_observed_at":"2026-08-07T14:44:24.109402Z","title":"Dynamic Sparse Training versus Dense Training: The Unexpected Winner in Image Corruption Robustness","venue":"cs.CV","work_id":"f94fde97-fb9d-4d04-bb7c-e8af1405ffba","year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.342479Z"},"links":{"cited_paper":"/paper/2410.03030","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:d317df0f0aec5380bc37bec2fbe13dfef8eeef6bea2aa72a61b06d5745736d98","observation_id":"a93aa535-4cb6-49d9-a8d2-eb4c852f792c","resolution":{"observed_at":"2026-08-07T14:44:24.210999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14831","last_updated":"2023-12-04T14:52:08Z","snapshot_observed_at":"2026-07-06T16:11:27.419669Z","submitted_at":"2023-08-28T18:31:09Z","title":"Continual Learning with Dynamic Sparse Training: Exploring Algorithms for Effective Model Updates","version":2},"cited_work":{"arxiv_id":"2308.14831","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14831","snapshot_observed_at":"2026-08-07T14:44:23.926066Z","title":"Continual Learning with Dynamic Sparse Training: Exploring Algorithms for Effective Model Updates","venue":"cs.LG","work_id":"d4d5e957-bbff-4a47-9fd7-47fff494b681","year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.442515Z"},"links":{"cited_paper":"/paper/2308.14831","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:0d6a602aaaf440b41a5586fed18b471d863cd20fcb49798e0302ed6cbc9563eb","observation_id":"00c1b99f-a601-44c6-ae5a-b96b42b7662f","resolution":{"observed_at":"2026-08-07T14:44:23.992254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05175","last_updated":"2025-06-30T22:16:39Z","snapshot_observed_at":"2026-08-01T08:08:15.221032Z","submitted_at":"2023-10-08T14:22:58Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05175","snapshot_observed_at":"2026-08-07T14:44:22.533903Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.533903Z"},"links":{"cited_paper":"/paper/2310.05175","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a2880417bcbbde4fa16551f4df9143465ad3753e1fe7b894ac6de45b98b5bec7","observation_id":"83154707-d389-4e84-a03c-0e9a35a6b810","resolution":{"observed_at":"2026-08-07T14:44:22.533903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11957","last_updated":"2025-03-03T17:04:08Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:43:56Z","title":"Drawing Early-Bird Tickets: Towards More Efficient Training of Deep Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11957","snapshot_observed_at":"2026-08-07T14:44:22.610368Z","title":"Baraniuk, Zhangyang Wang, and Yingyan Lin","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.610368Z"},"links":{"cited_paper":"/paper/1909.11957","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:875cae18fbbae9c1bfadeb6263fa0b4f86e41cbb2d0b0ed60086c8dabf92406f","observation_id":"965697d7-2da6-4398-9ee5-3364f3fcd26c","resolution":{"observed_at":"2026-08-07T14:44:22.610368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14032","last_updated":"2021-10-26T21:15:17Z","snapshot_observed_at":"2026-08-10T08:11:13.486825Z","submitted_at":"2021-10-26T21:15:17Z","title":"MEST: Accurate and Fast Memory-Economic Sparse Training Framework on the Edge","version":1},"cited_work":{"arxiv_id":"2110.14032","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.14032","snapshot_observed_at":"2026-08-07T14:44:23.736573Z","title":"MEST: Accurate and Fast Memory-Economic Sparse Training Framework on the Edge","venue":"cs.LG","work_id":"6d4ab535-e239-4aa8-918e-50854e6ccb8f","year":2021},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.701532Z"},"links":{"cited_paper":"/paper/2110.14032","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:e011a7904e381e84fa59f3b6676e76fb6dbb67776f4f7e82a372b2a54a540688","observation_id":"66b6f0d6-7a53-4bbd-aff4-509c9269ea76","resolution":{"observed_at":"2026-08-07T14:44:23.793230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07146","last_updated":"2017-06-14T06:06:48Z","snapshot_observed_at":"2026-08-08T14:57:17.868613Z","submitted_at":"2016-05-23T19:27:13Z","title":"Wide Residual Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07146","snapshot_observed_at":"2026-08-07T14:44:22.864692Z","title":"Wide Residual Networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:22.864692Z"},"links":{"cited_paper":"/paper/1605.07146","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:4d3e6c06173bff1f6951ef39c9933491ee1f57338dcdd3f69829f276d6cba7aa","observation_id":"ceba48ee-4491-4cff-9677-d2c3e4ec64ca","resolution":{"observed_at":"2026-08-07T14:44:22.864692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T14:44:23.014536Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence? Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.014536Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:a42e12b58103123062506a0c7588daddcf6b12e5839f8600c9ca557e96aed990","observation_id":"3be92767-aab7-481d-9441-5efc1227d076","resolution":{"observed_at":"2026-08-07T14:44:23.014536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.115529Z","title":"Brain-inspired sparse training enables Transformers and LLMs to perform as fully connected","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.115529Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:04f37ec304fa735068b6039280d400f68e14a46a89fa0b7be4b0fe777dbc7606","observation_id":"7b2f1288-742e-4992-bcec-2ad267819673","resolution":{"observed_at":"2026-08-07T14:44:23.115529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T14:44:23.169462Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.169462Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:b656169cb8e95ebbcbf8da3518782a3f08d0aa3e5bd9b1ce745663b2d72ca1b3","observation_id":"4f0d66af-7995-4241-a8f3-cbd11731efc1","resolution":{"observed_at":"2026-08-07T14:44:23.169462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03013","last_updated":"2022-11-06T02:59:27Z","snapshot_observed_at":"2026-07-06T14:14:54.215334Z","submitted_at":"2022-11-06T02:59:27Z","title":"Robust Lottery Tickets for Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03013","snapshot_observed_at":"2026-08-07T14:44:23.206606Z","title":"Robust Lottery Tickets for Pre-trained Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.206606Z"},"links":{"cited_paper":"/paper/2211.03013","citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:64e3cb9de4c4727d0d0bc943369797e5da2a2bf67e1ccd4a5d4ce33e3631a449","observation_id":"fcc68dc2-e072-4c77-b691-d4632248eb78","resolution":{"observed_at":"2026-08-07T14:44:23.206606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5555/2381019","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:23.239220Z","title":"Ensemble Methods: Foundations and Algorithms","venue":null,"work_id":"3994b3ab-ccea-42bb-b8f9-eff99a368a0f","year":2012},"citing_paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T14:44:23.210297Z"},"links":{"citing_paper":"/paper/2505.17909"},"observation_digest":"sha256:6f79da0010d22b7b0ab9d86ff492327c8a81ebe882e03a5122e546de18b7bcdb","observation_id":"64500586-55ab-44f4-9a0c-51c43c7515b2","resolution":{"observed_at":"2026-08-07T14:44:23.274690Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17909","last_updated":"2025-05-23T13:53:21Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:19:48.354728Z","submitted_at":"2025-05-23T13:53:21Z","title":"NeuroTrails: Training with Dynamic Sparse Heads as the Key to Effective Ensembling"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":56,"verified_exact":17,"verified_fuzzy":9},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2505.17909."}