{"as_of":"2026-08-15T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08eb2f1eaf80bddaa3df765b84a3a65904c0ead9f16cee71633ee8746b5939ce","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:15:17.887587Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:39:39.275110Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11449","snapshot_observed_at":"2026-08-04T09:39:39.275110Z","title":"Dynamic sparse training of diagonally sparse networks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14812","last_updated":"2026-07-21T01:15:24Z","snapshot_observed_at":"2026-08-08T13:33:42.479383Z","submitted_at":"2025-10-16T15:48:17Z","title":"SHUFFLESPARSE: Learned Shuffles for Structured Sparse Networks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T09:39:39.275110Z"},"links":{"cited_paper":"/paper/2506.11449","citing_paper":"/paper/2510.14812"},"observation_digest":"sha256:a178f9b1ceebe0b5c76a832f31c3a22621555bfe1ceb14cbe8d0d5fc743b5e4e","observation_id":"03673a12-845b-497e-8a52-82f07014e9df","resolution":{"observed_at":"2026-08-04T09:39:39.275110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11449/citation-record","integrity":"/paper/2506.11449/integrity","json":"/paper/2506.11449/citation-record.json","paper":"/paper/2506.11449"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:12.121642Z","title":"and Albert, R","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.121642Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:663add04e0f057750516fbb41bef999e4695d9f92dfe9efcf482fd9b76200882","observation_id":"acb8e67f-a596-4da7-82fd-7545c858c552","resolution":{"observed_at":"2026-08-07T04:15:12.121642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.071083Z","title":"J., Frankle, J., and Guttag, J","venue":null,"work_id":"37d71d03-9999-4bb7-b209-c7742478ab1c","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.186921Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:319ee8b1341653f8dc77d25c3a10b2a116116e5ea5a98fbb10a18eda11fb3953","observation_id":"0c65c711-4611-4b73-bcad-1643c1c48c3c","resolution":{"observed_at":"2026-08-07T04:15:19.074082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02549","last_updated":"2022-05-31T07:25:52Z","snapshot_observed_at":"2026-08-13T16:29:15.047254Z","submitted_at":"2022-03-04T19:54:31Z","title":"Structured Pruning is All You Need for Pruning CNNs at Initialization","version":2},"cited_work":{"arxiv_id":"2203.02549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02549","snapshot_observed_at":"2026-08-07T04:15:18.718830Z","title":"Structured Pruning is All You Need for Pruning CNNs at Initialization","venue":"cs.CV","work_id":"59d45684-ff6c-437c-a55a-c4b51cd37a33","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.251200Z"},"links":{"cited_paper":"/paper/2203.02549","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:7d9768a160dd020e6102918e863f3705a1c36344abc70cdc684493d08056f1cb","observation_id":"40e19aa5-6df1-4f8e-9572-30c231f7e5f6","resolution":{"observed_at":"2026-08-07T04:15:18.722802Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09844","last_updated":"2022-02-27T07:42:30Z","snapshot_observed_at":"2026-08-13T16:37:48.088415Z","submitted_at":"2022-02-20T15:52:08Z","title":"Sparsity Winning Twice: Better Robust Generalization from More Efficient Training","version":3},"cited_work":{"arxiv_id":"2202.09844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.09844","snapshot_observed_at":"2026-08-07T04:15:18.705647Z","title":"Sparsity Winning Twice: Better Robust Generalization from More Efficient Training","venue":"cs.CV","work_id":"0312bc34-58f2-4544-a5de-e27cb9edd0e2","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.355089Z"},"links":{"cited_paper":"/paper/2202.09844","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0f8685dd438d076d23f2852621ef88c987751319f9592f343fbbc27e40ac9474","observation_id":"57136f77-88a8-4ef1-80eb-f5a0bff34629","resolution":{"observed_at":"2026-08-07T04:15:18.709283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.061609Z","title":"Which layer is learning faster? a systematic exploration of layer-wise convergence rate for deep neural networks","venue":null,"work_id":"19a9ac3f-e423-4f3b-a214-14c5340e25fd","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.417872Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:2425a20f16b7286c891d535e37af4f131a93473cff9996c1bac520c2e2889878","observation_id":"a03bc3e3-c953-4975-a4bf-0ebc323ccdd5","resolution":{"observed_at":"2026-08-07T04:15:19.064856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.051686Z","title":"Trends in the dollar training cost of machine learning systems","venue":null,"work_id":"15c07469-d378-402c-9a93-0d4a5057cc3a","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.464154Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0ed3eed8e119d081b5802db0f498030a9efd6a0a02d45cf40c6ee8f0969ec109","observation_id":"ed57bb53-d414-4c72-8f9a-d1a9fcf79d0a","resolution":{"observed_at":"2026-08-07T04:15:19.054770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00029","last_updated":"2022-05-11T03:59:56Z","snapshot_observed_at":"2026-08-14T12:53:13.574092Z","submitted_at":"2021-11-30T19:00:03Z","title":"Pixelated Butterfly: Simple and Efficient Sparse training for Neural Network Models","version":2},"cited_work":{"arxiv_id":"2112.00029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00029","snapshot_observed_at":"2026-08-07T04:15:18.691750Z","title":"Pixelated Butterfly: Simple and Efficient Sparse training for Neural Network Models","venue":"cs.LG","work_id":"e66f364c-25db-4b79-ad38-eada6fdaade9","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.550091Z"},"links":{"cited_paper":"/paper/2112.00029","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f9e11757d61045b28762f951072ed7b1ad3a8c82ac69d2546313951648cbce59","observation_id":"729345dd-2fd7-435f-8055-f165664cb38d","resolution":{"observed_at":"2026-08-07T04:15:18.695298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:12.682619Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.682619Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:559d05ad4ba3ed1ab99da9b3b2af4da7f34e2c05cd9695cfeab23e97d0c94d11","observation_id":"b08614df-628b-4ec4-80b7-315afda6cbf6","resolution":{"observed_at":"2026-08-07T04:15:12.682619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T04:15:12.689627Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.689627Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:231c2771a65fbd13e431d02284ea37baa986b76af825aa7ad32af04700cd74a0","observation_id":"977f8781-5290-41ff-b990-5bceaf766a17","resolution":{"observed_at":"2026-08-07T04:15:12.689627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.036091Z","title":"S., and Elsen, E","venue":null,"work_id":"ba945dfa-e4b7-4d18-a111-b5d40bf09e58","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.780599Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:fcc0582d0dbb075e8b187a9c112599aa95196e45f754a0bf081f6d58543015d4","observation_id":"71af4c9d-60e1-47e4-8570-205ac0ffbac1","resolution":{"observed_at":"2026-08-07T04:15:19.038904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-07T04:15:12.943651Z","title":"and Carbin, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:12.943651Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:1c4173ddee8f469f630e5538603cb4f8158632b1d5a984c0e0c30dc2ad49936e","observation_id":"9d4ee057-f126-4d8c-a6fc-337b5c2be220","resolution":{"observed_at":"2026-08-07T04:15:12.943651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.026292Z","title":"Learning both weights and connections for efficient neural network","venue":null,"work_id":"b2d5dd98-621b-4546-8a48-6e4fe0da70b5","year":2015},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.074504Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:997cc855b1fd87bf12097ff7d49da8c2b1b85152b8fd1923543c3e58a35c160e","observation_id":"7f6f46cb-5ac4-4c29-885d-22f25bc2d968","resolution":{"observed_at":"2026-08-07T04:15:19.029862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01847","last_updated":"2024-10-27T14:40:08Z","snapshot_observed_at":"2026-08-15T02:30:08.686833Z","submitted_at":"2024-04-02T11:12:42Z","title":"Accelerating Transformer Pre-training with 2:4 Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01847","snapshot_observed_at":"2026-08-07T04:15:13.191537Z","title":"Accelerating transformer pre-training with 2: 4 sparsity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.191537Z"},"links":{"cited_paper":"/paper/2404.01847","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:986c99a6115838ff29ff90bab6a6bef40804360bf46d1b01934c4b4cf164f46a","observation_id":"d152cb25-3ae8-4cb1-8d13-4394713d80a0","resolution":{"observed_at":"2026-08-07T04:15:13.191537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.016751Z","title":"Accelerated sparse neural training: A provable and efficient method to find n: m transposable masks","venue":null,"work_id":"637f7b6e-5bcf-4d43-af9d-e4d6d0a8378c","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.289616Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:3db72b198ccc773796e3a508bca6e9bc2a1bc4fe80ed5d838e5aa4746686d26e","observation_id":"eb264363-b1d7-4191-8313-f4a6585a3587","resolution":{"observed_at":"2026-08-07T04:15:19.020080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:19.006355Z","title":"K., Ma, H., Chen, T., Ding, Y., and Wang, Z","venue":null,"work_id":"8ad5e3ca-b36e-4282-bc0b-b49af1a35037","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.447084Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f4341d2e43b1570b300942ae31f04cb6a4594a3de99a29ce8499676aed22ad78","observation_id":"2a86ee1d-d278-4d43-90fe-7ca10031e26e","resolution":{"observed_at":"2026-08-07T04:15:19.009947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.997142Z","title":"Top-kast: Top-k always sparse training","venue":null,"work_id":"5e64db62-af9f-435f-991a-486f28875485","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.607857Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f5e75fe62adf5022ade51d80f830d5cb441bfae0d68dad0cf5a6ff7ef611a45f","observation_id":"53d379a7-a660-408d-a7a2-fc6d8e2f386a","resolution":{"observed_at":"2026-08-07T04:15:19.000124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.988190Z","title":"Advancing dynamic sparse training by exploring optimization opportunities","venue":null,"work_id":"f0e9faec-2413-40c3-ad8f-a9ada15f9350","year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.735936Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:07004ec51ebf247980339bcc4974b6360c6d8a3963605cf9c277c5c2d504ea35","observation_id":"4518509c-4179-46b5-bb1b-c9b859935517","resolution":{"observed_at":"2026-08-07T04:15:18.991215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.978569Z","title":"Exposing and exploiting fine-grained block structures for fast and accurate sparse training","venue":null,"work_id":"01cc2c56-e45e-4273-a1b0-6e7855212803","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.836746Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:1ca908b392801afeb77322859d92660bcdb23feecd2abbf58bdcd2aa83faeb4f","observation_id":"ba21eaf3-10cc-43a7-a18a-4e01981b2559","resolution":{"observed_at":"2026-08-07T04:15:18.981703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.969387Z","title":"and Hinton, G","venue":null,"work_id":"d0a8058c-9fc8-4bad-a42c-b78b1854fc7c","year":2009},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:13.981699Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:fbe543647d4dd202cd2fb4f14ed87fe6f410773db49d15a0c38e9f7497a91d8a","observation_id":"fec6f463-af22-4611-bbde-0e662c2edf4e","resolution":{"observed_at":"2026-08-07T04:15:18.972521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02060","last_updated":"2023-09-08T14:45:48Z","snapshot_observed_at":"2026-08-13T10:40:57.713275Z","submitted_at":"2023-08-03T21:49:14Z","title":"Accurate Neural Network Pruning Requires Rethinking Sparse Optimization","version":2},"cited_work":{"arxiv_id":"2308.02060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02060","snapshot_observed_at":"2026-08-07T04:15:18.647867Z","title":"Accurate Neural Network Pruning Requires Rethinking Sparse Optimization","venue":"cs.LG","work_id":"7a6310d9-187a-470d-a6e8-8a8477b72fb6","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.110136Z"},"links":{"cited_paper":"/paper/2308.02060","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e8eae915eabc3a5b88edee3fec0a85ac8a472813672a050b093e976df87866e5","observation_id":"1dba2fb0-3faa-4f49-817c-4cde8a6a2d67","resolution":{"observed_at":"2026-08-07T04:15:18.651445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.960231Z","title":"S., Bernaschi, M., Nutt, W., Silvestri, F., and Vella, F","venue":null,"work_id":"8bbb3b7a-f56d-4dd1-8edd-c8c50c6fdab6","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.267434Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:a742d57a92cd2ebde538ec9a88658ac249c5297a0a91ac9470acee96a7b1359a","observation_id":"d9d85d36-5aa3-4e38-af01-d63c744a2aaa","resolution":{"observed_at":"2026-08-07T04:15:18.963332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:14.387444Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.387444Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:cfb2aab08118f05868c1119b20480f02b6f7b3e082936ce6635a2839e8935c8a","observation_id":"ae4f1b34-4b9d-4e5a-a0b8-3d2d4a9c22da","resolution":{"observed_at":"2026-08-07T04:15:14.387444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02299","last_updated":"2024-02-21T23:31:49Z","snapshot_observed_at":"2026-08-13T11:49:55.115291Z","submitted_at":"2023-05-03T17:48:55Z","title":"Dynamic Sparse Training with Structured Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02299","snapshot_observed_at":"2026-08-07T04:15:14.519561Z","title":"Dynamic sparse training with structured sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.519561Z"},"links":{"cited_paper":"/paper/2305.02299","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:8fff3241dc3e8b90a0431133d97bed4b06d59da1d41d548238081ed77c797b19","observation_id":"4c9d4b81-0a21-4600-a0c2-d683edb36dc6","resolution":{"observed_at":"2026-08-07T04:15:14.519561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02340","last_updated":"2019-02-23T07:45:29Z","snapshot_observed_at":"2026-08-14T18:19:22.875247Z","submitted_at":"2018-10-04T17:39:58Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02340","snapshot_observed_at":"2026-08-07T04:15:14.642977Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.642977Z"},"links":{"cited_paper":"/paper/1810.02340","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:961a7ce6f007e015b67dec0a550ee1d35a2429bfdba9054cae92e715e66f6369","observation_id":"e337ac52-7dca-4964-b444-d612ec7569d4","resolution":{"observed_at":"2026-08-07T04:15:14.642977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.944682Z","title":"Towards optimal structured cnn pruning via generative adversarial learning","venue":null,"work_id":"c68614ac-b2c1-4112-9bed-7315b1e35ca2","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.756071Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:ca390ead22c0d55f9af74d4b4278139f4f2b9bd0fcbcccdebe90830e8593e383","observation_id":"692a9328-fde3-49fc-afea-0ca883c2da92","resolution":{"observed_at":"2026-08-07T04:15:18.947681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.934840Z","title":"and Wang, Z","venue":null,"work_id":"4ebcb52c-8d63-4ed1-9918-07aa719303ab","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:14.851369Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:3e1ee12da44d31acaa41f287c15ca7c7844a1b2019be3a0e6d8eb7b6bd853945","observation_id":"dd0bc6a1-2762-4932-903e-ef7d01e03c76","resolution":{"observed_at":"2026-08-07T04:15:18.938390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11626","last_updated":"2019-06-27T13:31:30Z","snapshot_observed_at":"2026-08-02T11:51:02.442023Z","submitted_at":"2019-06-27T13:31:30Z","title":"On improving deep learning generalization with adaptive sparse connectivity","version":1},"cited_work":{"arxiv_id":"1906.11626","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.11626","snapshot_observed_at":"2026-08-07T04:15:18.613894Z","title":"On improving deep learning generalization with adaptive sparse connectivity","venue":"cs.NE","work_id":"4f42b0fb-f4bd-4eee-bb34-20fa57c627c5","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.027008Z"},"links":{"cited_paper":"/paper/1906.11626","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0dc51c3f2b5701672f4daa1d67b32f411ba0b37a1ac6be55a30e8594b08bdcec","observation_id":"62e2ff50-b76c-4170-be81-a06b11055d52","resolution":{"observed_at":"2026-08-07T04:15:18.617358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10912","last_updated":"2024-10-14T03:35:11Z","snapshot_observed_at":"2026-08-14T17:48:29.769904Z","submitted_at":"2024-10-14T03:35:11Z","title":"AlphaPruning: Using Heavy-Tailed Self Regularization Theory for Improved Layer-wise Pruning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10912","snapshot_observed_at":"2026-08-07T04:15:15.173321Z","title":"W., and Yang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.173321Z"},"links":{"cited_paper":"/paper/2410.10912","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0fa8ff7ba4169d93ff36b0aef421a4da932fce2749b71ccc3f3ea1f331387242","observation_id":"bd0d52fe-8eb6-4fb0-8b65-76e695a353d5","resolution":{"observed_at":"2026-08-07T04:15:15.173321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"article/2402645","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.586575Z","title":"Ai beats humans for the first time in physical skill game","venue":null,"work_id":"f4c6f681-ba73-43b3-a005-7ca3a0f772f8","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.284906Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:b4c4ef8f21e7341df2486cf000add03b38498cd06977757ad053703b32c7f043","observation_id":"289693ac-41ec-4bc2-b540-6806beeba823","resolution":{"observed_at":"2026-08-07T04:15:18.591396Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.924739Z","title":null,"venue":null,"work_id":"ee281715-999e-4331-86d8-f43bb8b3feef","year":1993},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.411618Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:47e9b239fac76f897195197a15041adc784a40a994078940b524e9f85aaff594","observation_id":"83104951-6e69-4b4e-a2c7-035a7bd45907","resolution":{"observed_at":"2026-08-07T04:15:18.928197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T04:15:15.495104Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.495104Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:919067a218f9c97d924051b793c816c6d9ea88e2c2e10b40ff6c95ea639a8e95","observation_id":"f72043d6-96c0-4463-9b1d-431d8a98c81f","resolution":{"observed_at":"2026-08-07T04:15:15.495104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-13T19:38:24.671428Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-07T04:15:15.580457Z","title":"A., Pool, J., Stosic, D., Stosic, D., Venkatesh, G., Yu, C., and Micikevicius, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.580457Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:a752e76674f1cafcb8aee887140618214a4cdec4bee1313946aeacd5fea97153","observation_id":"b3434182-04bd-466f-bd00-afc3df276a46","resolution":{"observed_at":"2026-08-07T04:15:15.580457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.913987Z","title":"C., Mocanu, E., Stone, P., Nguyen, P","venue":null,"work_id":"7e8a29bf-37f0-4680-b314-18810aaed8a9","year":2018},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.689578Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:42074f2db89644779be89365bb582a56f8c60f203891f453ea9d40058377f2ff","observation_id":"ceafbc9e-6f8a-4068-a8d1-d6ddccedd90e","resolution":{"observed_at":"2026-08-07T04:15:18.917396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.903914Z","title":"Variational dropout sparsifies deep neural networks","venue":null,"work_id":"26406956-9a47-432c-a7cd-81fcb4a3beb0","year":2017},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.771170Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e57db266793ecf308284d307315c2f8d3d58523f149ef4ba4c84844d9237f532","observation_id":"5f638935-eea7-4fe0-922c-40062837fb54","resolution":{"observed_at":"2026-08-07T04:15:18.907093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-14T21:29:36.502364Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-07T04:15:15.880234Z","title":"Pruning convolutional neural networks for resource efficient inference","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.880234Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:03bcebc2d29161d9623977091981fa101902106f0ffa3c5055c38cf946344c96","observation_id":"227376ee-6b74-4c76-b984-06bab8181380","resolution":{"observed_at":"2026-08-07T04:15:15.880234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.893568Z","title":"Importance estimation for neural network pruning","venue":null,"work_id":"9c66d36c-53f4-4a22-bb91-dd8670e6800b","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:15.969164Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:12c360e888e2017c673db22c894b71b0b749cd6a333279e1a5cbf7420a965982","observation_id":"90ce7414-658d-4032-85a2-07b4da0ec235","resolution":{"observed_at":"2026-08-07T04:15:18.897082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.883616Z","title":"and Wang, X","venue":null,"work_id":"3330d4b2-a690-4459-a784-0696bd495ce1","year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.070264Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0544af9b6bfbec109f25a024b9de2f56ed190fdb7ad71a481dcea8c6e755731c","observation_id":"9cd46bb6-90ba-4ce9-aed3-c216d41b24cc","resolution":{"observed_at":"2026-08-07T04:15:18.886787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.872552Z","title":"S., Besta, M., Vella, F., and Hoefler, T","venue":null,"work_id":"1a7b00f7-ef25-4013-b2a1-2bd768bca2d6","year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.197211Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:c6d84787ccaa2c423b4ecb4c3d731530bc51051cd23740e0a703c3d8b4a3e34c","observation_id":"bfb3db17-fd5a-4647-8287-cdc359742e2c","resolution":{"observed_at":"2026-08-07T04:15:18.875946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:16.282965Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.282965Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:14ccc3c06966683ff626053a84faa2a44efed29ab09b85b73701158ceed2a095","observation_id":"06e341cd-7ab5-48ef-987f-b7d685c155a5","resolution":{"observed_at":"2026-08-07T04:15:16.282965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.857089Z","title":"E., Puigcerver, J., Djolonga, J., Peyr \\'e , G., and Blondel, M","venue":null,"work_id":"6885178f-906b-4b06-9b9d-cea9db875dad","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.383763Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:08c6a7cfb3a592633005a56fea4a31ef61cd09266cbe4da9591065ece77df698","observation_id":"1952fe18-e200-4e61-ae24-c536886ba887","resolution":{"observed_at":"2026-08-07T04:15:18.860400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.847693Z","title":"Game-playing deepmind ai can beat top humans at chess, go and poker","venue":null,"work_id":"a312390c-878d-4fd9-a7bc-7e04acdac665","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.491995Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0fd6549d5387ae2a200fe92a1e441e2f3b32051c87577203c7544a0402e6cde1","observation_id":"7858e193-bf33-40df-929e-318005c0add0","resolution":{"observed_at":"2026-08-07T04:15:18.850927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T04:15:16.634343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.634343Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:66f118948a68a7ae3450daa49a147d78c61079200f323d2646c2d5d8a80bc01c","observation_id":"350429b3-ba93-4a8c-8596-34381aed502b","resolution":{"observed_at":"2026-08-07T04:15:16.634343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.836458Z","title":"L., and Ganguli, S","venue":null,"work_id":"8b059654-9fd4-4c86-8b75-4826a6b02f6c","year":2020},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.786934Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e1147031a167d4a914bf35e1bca1260e35779abaf3c7d16867f2051ed1aeaa60","observation_id":"addffe9e-c86d-4ac9-b2ae-95317f84a5ef","resolution":{"observed_at":"2026-08-07T04:15:18.839889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.825569Z","title":"K., Joyce, K","venue":null,"work_id":"13086a18-b9ed-402a-85df-6d07141845ba","year":2011},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.913534Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e39bd936424b195b13681a94d853b4fe82d51cb6d98cabbd8bdd68eb8be3e930","observation_id":"ae1a8ba8-6f04-44ea-8375-e5fb078e67d4","resolution":{"observed_at":"2026-08-07T04:15:18.828880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.814406Z","title":"O., Houlsby, N., Kolesnikov, A., Beyer, L., Zhai, X., Unterthiner, T., Yung, J., Steiner, A., Keysers, D., Uszkoreit, J., et al","venue":null,"work_id":"51ae1a6f-19ff-42f8-b26c-c967b470bcdb","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:16.958211Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:439389f09a4a0379ceaf6fa12b5063b654384cf30f9ce5e52a4d65441ede3144","observation_id":"91123f71-7a2b-406f-b4f6-9f44c16ce817","resolution":{"observed_at":"2026-08-07T04:15:18.818048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-10T04:53:00.900945Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-07T04:15:17.025375Z","title":"Picking winning tickets before training by preserving gradient flow","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.025375Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:ab325b2feed236eb66fc14a08edf0fc5b588f139bf04fbc931acafb218cd0082","observation_id":"e7fd8b2d-45e8-4de9-ad77-f721bf722307","resolution":{"observed_at":"2026-08-07T04:15:17.025375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.803029Z","title":null,"venue":null,"work_id":"749faf85-c926-435d-969a-5e38b3ed1450","year":1998},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.141937Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:579ecccf0f69a057654f8d33c1f83965a4cda360a50178875b587fdcdf7dc530","observation_id":"10faa5a7-a836-4566-9fbb-905bd2f1f672","resolution":{"observed_at":"2026-08-07T04:15:18.806267Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.792559Z","title":"and Busato, F","venue":null,"work_id":"218de94e-fd15-4a1e-a74e-e323fb874449","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.266215Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f3c09e99195d0ba292a7bf46cbf1da626571f719799884f6f9cd62a89361b326","observation_id":"9f07e15e-e391-4d60-ba4c-8de272312296","resolution":{"observed_at":"2026-08-07T04:15:18.795946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00335","last_updated":"2023-01-29T22:05:59Z","snapshot_observed_at":"2026-08-13T13:11:53.585992Z","submitted_at":"2023-01-01T03:10:45Z","title":"Pruning Before Training May Improve Generalization, Provably","version":3},"cited_work":{"arxiv_id":"2301.00335","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.00335","snapshot_observed_at":"2026-08-07T04:15:18.349026Z","title":"Pruning Before Training May Improve Generalization, Provably","venue":"cs.LG","work_id":"1a7c3d6f-0214-43d8-95d8-d03fbd447dbd","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.280525Z"},"links":{"cited_paper":"/paper/2301.00335","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:0d9aa9a9f34b58af142d213150c423197ebd36885486e51948c14805417cd5df","observation_id":"3376bb61-0524-49a5-8cad-369bc5a2645a","resolution":{"observed_at":"2026-08-07T04:15:18.418513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.782641Z","title":"Global vision transformer pruning with hessian-aware saliency","venue":null,"work_id":"960a743f-2fec-4bf6-992b-aac86527a496","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.284679Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:d731df0b14b47cf69118da0c8a9ca3356b68ce92b1047164c62fe0d76f3a657f","observation_id":"58184fa3-9626-463e-9c5b-9e2a9ce7a595","resolution":{"observed_at":"2026-08-07T04:15:18.785703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.772397Z","title":"Width & depth pruning for vision transformers","venue":null,"work_id":"1eb9c726-1461-47be-b459-f471a843fdb4","year":2022},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.353691Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:a7fbb2932e82063f672af8f4bf6edc176bbebaec0ec45c6c868f03a87499c0d8","observation_id":"a70fae9d-7254-4917-9757-0b8da493eb05","resolution":{"observed_at":"2026-08-07T04:15:18.776186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.762487Z","title":"Mest: Accurate and fast memory-economic sparse training framework on the edge","venue":null,"work_id":"267ffbba-b488-4454-a5ac-d56d5c2a40fb","year":2021},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.434429Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:e0dcb85b80c853b7fc811fd631b78b39b0353b0c66765c69c9538e602df410fb","observation_id":"e72ec91d-b684-4177-b31d-22ebdc9b0321","resolution":{"observed_at":"2026-08-07T04:15:18.765956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03303","last_updated":"2026-05-09T05:30:15Z","snapshot_observed_at":"2026-08-13T08:01:16.750424Z","submitted_at":"2023-08-07T05:12:27Z","title":"LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03303","snapshot_observed_at":"2026-08-07T04:15:17.585257Z","title":"Lora-fa: Memory-efficient low-rank adaptation for large language models fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.585257Z"},"links":{"cited_paper":"/paper/2308.03303","citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:8437864660e62ad7d24bad7103e00dcb1c0398ccd2f380936d5131b6e8a853e8","observation_id":"73226ca3-5aff-4b80-840d-df22a66609df","resolution":{"observed_at":"2026-08-07T04:15:17.585257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.750618Z","title":"M., Yan, G., and Li, X","venue":null,"work_id":"c3d0a921-22e4-4487-a218-20e46979b929","year":2023},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.589660Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:7e11fe0e64f17067bbdfab94561351a870b174e9dae966ee5613d13c796ba307","observation_id":"8e7ba500-4ae3-4b2b-af2f-6e6ba0cd9ca6","resolution":{"observed_at":"2026-08-07T04:15:18.754750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.739632Z","title":null,"venue":null,"work_id":"46907158-e8ed-4451-9c65-acb5bb56e932","year":2024},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.665272Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:7410760f66a3e4202bfd1d9146625d0a51cd0839a5a10fe17a40d9778fe1c029","observation_id":"c3079ea3-c142-4968-b340-ab9909a34f67","resolution":{"observed_at":"2026-08-07T04:15:18.743027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.19107","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:18.218704Z","title":null,"venue":null,"work_id":"0a2a3791-4947-49fc-86ec-e5ec68f545d2","year":2025},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.779718Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:f5cf3c4459369b4bf657321afe7e6360046210a2619e6cf8477a754edc577394","observation_id":"c5a433ee-edba-4552-8c21-6b8c74307a28","resolution":{"observed_at":"2026-08-07T04:15:18.249954Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:15:17.887587Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T04:15:17.887587Z"},"links":{"citing_paper":"/paper/2506.11449"},"observation_digest":"sha256:92689bc4b9f12e635e8725222f474f02b28f229c629351f0ddedc78107a85af8","observation_id":"ed35a736-af75-43be-995c-af4228503acf","resolution":{"observed_at":"2026-08-07T04:15:17.887587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11449","last_updated":"2025-06-13T04:01:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T04:33:16.496512Z","submitted_at":"2025-06-13T04:01:34Z","title":"Dynamic Sparse Training of Diagonally Sparse Networks"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":20,"verified_exact":6,"verified_fuzzy":29},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.11449."}