{"as_of":"2026-08-15T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:809fff268ec935119a241d65cdb1e011e1d497fcc0848d7ddf53a4cb2d528e44","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:22:43.753540Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:07:18.824996Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:07:20.818411Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"cited_work":{"arxiv_id":"2411.09816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.09816","snapshot_observed_at":"2026-08-06T18:07:20.818411Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","venue":"cs.LG","work_id":"d8e42f5a-ed83-4ccb-8358-03f3a2d510e6","year":2024},"citing_paper":{"arxiv_id":"2507.09428","last_updated":"2025-07-12T23:39:14Z","snapshot_observed_at":"2026-08-14T09:36:02.330950Z","submitted_at":"2025-07-12T23:39:14Z","title":"On Information Geometry and Iterative Optimization in Model Compression: Operator Factorization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T18:07:18.824996Z"},"links":{"cited_paper":"/paper/2411.09816","citing_paper":"/paper/2507.09428"},"observation_digest":"sha256:88710bce5a17b0146313a4f1e4bb63c2f1d7ad1f0ecb245d0519987132cf88ea","observation_id":"bcad8d87-ab76-4c8e-96c7-711627e65d0e","resolution":{"observed_at":"2026-08-06T18:07:20.894309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.09816/citation-record","integrity":"/paper/2411.09816/integrity","json":"/paper/2411.09816/citation-record.json","paper":"/paper/2411.09816"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.13255","last_updated":"2020-12-22T07:42:30Z","snapshot_observed_at":"2026-08-14T01:48:39.766084Z","submitted_at":"2020-12-22T07:42:30Z","title":"Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13255","snapshot_observed_at":"2026-08-12T20:22:43.581723Z","title":"Intrinsic dimensionality explains the effectiveness of language model fine-tuning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.581723Z"},"links":{"cited_paper":"/paper/2012.13255","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:3707b01fe99ef894c9b0e072f8b4a79cf350dba9418f5c79dd965713e9df69a9","observation_id":"46abba2e-a388-4126-a101-33d6bbd11783","resolution":{"observed_at":"2026-08-12T20:22:43.581723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05641","last_updated":"2016-04-23T23:14:39Z","snapshot_observed_at":"2026-08-14T22:22:29.244209Z","submitted_at":"2015-11-18T02:09:20Z","title":"Net2Net: Accelerating Learning via Knowledge Transfer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05641","snapshot_observed_at":"2026-08-12T20:22:43.587757Z","title":"Net2net: Accelerating learning via knowledge transfer, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.587757Z"},"links":{"cited_paper":"/paper/1511.05641","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:a15ca9411c572c139d6daafe0bcbe418b39edd6eb2152a7b6cfd92c4e100e6ff","observation_id":"2985e36f-9222-4db7-a991-ca76a87cb4d8","resolution":{"observed_at":"2026-08-12T20:22:43.587757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09282","last_updated":"2020-06-14T19:10:03Z","snapshot_observed_at":"2026-08-14T20:21:05.078282Z","submitted_at":"2017-10-23T20:16:55Z","title":"A Survey of Model Compression and Acceleration for Deep Neural Networks","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09282","snapshot_observed_at":"2026-08-12T20:22:43.594335Z","title":"A survey of model compression and acceleration for deep neural networks, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.594335Z"},"links":{"cited_paper":"/paper/1710.09282","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:88826d608f6b3ad4474e73710b5ab25edcf9c7b541c8e19c15ec0dda684ef69e","observation_id":"68b1ee71-d573-4453-bc09-1ef64faec237","resolution":{"observed_at":"2026-08-12T20:22:43.594335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.383858Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"3810dbf2-3ec7-423c-8d6c-3987bb7ad3cc","year":2009},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.599597Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:17b6d95c9aa63120fce792d3e4a14333adff5dd0d71285169936a0e24ee0a9b3","observation_id":"b35ccde5-f87a-4dde-86ef-93e50f5c323d","resolution":{"observed_at":"2026-08-12T20:22:44.389859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T20:22:43.604545Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.604545Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:8fcf37180037804848d83939b2d14b2ba9b76c927c13309abb4660e5281fbcf4","observation_id":"90e56b36-1887-42c8-be0e-f5802f32ae68","resolution":{"observed_at":"2026-08-12T20:22:43.604545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11177","last_updated":"2019-11-25T19:21:25Z","snapshot_observed_at":"2026-08-13T19:24:52.931106Z","submitted_at":"2019-11-25T19:21:25Z","title":"Structured Multi-Hashing for Model Compression","version":1},"cited_work":{"arxiv_id":"1911.11177","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.11177","snapshot_observed_at":"2026-08-12T20:22:44.119779Z","title":"Structured Multi-Hashing for Model Compression","venue":"cs.LG","work_id":"326c5cb8-5ff0-4919-b078-0ace723e5319","year":2019},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.609777Z"},"links":{"cited_paper":"/paper/1911.11177","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:012b82c9053f9d3418f70c411a70c05c4b78dd7db348569169018eb813d0af56","observation_id":"aceb3a6c-7151-426a-a5a4-2333df4037cb","resolution":{"observed_at":"2026-08-12T20:22:44.125773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11134","last_updated":"2021-07-23T14:12:42Z","snapshot_observed_at":"2026-07-06T08:39:52.703032Z","submitted_at":"2019-11-25T18:58:53Z","title":"Rigging the Lottery: Making All Tickets Winners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11134","snapshot_observed_at":"2026-08-12T20:22:43.615659Z","title":"Rigging the lottery: Making all tickets winners, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.615659Z"},"links":{"cited_paper":"/paper/1911.11134","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:30682a1706fb9bb2500e365758107f5f7fa894485c14827ad14ae5b3a37d37ad","observation_id":"f159c5b0-9b91-4ac1-8cc2-e9810d49503f","resolution":{"observed_at":"2026-08-12T20:22:43.615659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05125","last_updated":"2022-06-07T15:29:01Z","snapshot_observed_at":"2026-08-15T11:58:15.149289Z","submitted_at":"2022-01-13T18:30:18Z","title":"GradMax: Growing Neural Networks using Gradient Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05125","snapshot_observed_at":"2026-08-12T20:22:43.620521Z","title":"Gradmax: Growing neural networks using gradient information, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.620521Z"},"links":{"cited_paper":"/paper/2201.05125","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:9fe0fc0021b83204d8ff24692799624a0445ed885d14f8941d4701f64f22fc72","observation_id":"80e2e3f7-0271-4ae9-bba3-78587960d69b","resolution":{"observed_at":"2026-08-12T20:22:43.620521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.01852","last_updated":"2015-02-06T10:44:00Z","snapshot_observed_at":"2026-08-14T23:01:07.044616Z","submitted_at":"2015-02-06T10:44:00Z","title":"Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.01852","snapshot_observed_at":"2026-08-12T20:22:43.625597Z","title":"Delving deep into rectifiers: Surpassing human-level performance on imagenet classification, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.625597Z"},"links":{"cited_paper":"/paper/1502.01852","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:4ba2926a6accb90d327775ccf3838ae9afd1a382eff86e17112c15509df71b08","observation_id":"304b63d5-8303-4525-8a40-77c78770f44a","resolution":{"observed_at":"2026-08-12T20:22:43.625597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.367138Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":"96d96bac-1c59-4b56-91fa-a0016bb4b759","year":2015},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.630804Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:eb7622fa7d99dc34fbdd50ea091df294c67e996344ccbd69fb1b12b32cf98dc4","observation_id":"c268e351-d8fc-4a38-b105-54b4645adf36","resolution":{"observed_at":"2026-08-12T20:22:44.372417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.00554","last_updated":"2021-01-31T22:48:50Z","snapshot_observed_at":"2026-08-13T20:22:16.724751Z","submitted_at":"2021-01-31T22:48:50Z","title":"Sparsity in Deep Learning: Pruning and growth for efficient inference and training in neural networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.00554","snapshot_observed_at":"2026-08-12T20:22:43.635783Z","title":"Sparsity in deep learning: Pruning and growth for efficient inference and training in neural networks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.635783Z"},"links":{"cited_paper":"/paper/2102.00554","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:185803037a577cc309442b773f78cf566db1e05ef9c013ca1b2a77e9c8f7ca4d","observation_id":"1711f637-1a21-424a-8050-0b95a30920b5","resolution":{"observed_at":"2026-08-12T20:22:43.635783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.350881Z","title":"Kolda and Brett W","venue":null,"work_id":"2cc56b5f-ac61-4532-b3dc-cb8139b3c21a","year":2009},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.640747Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:e821cfd38003c49c92536d5fd5ccc8f08db9d3706d75552a09b63568f3304832","observation_id":"24ea524c-db5d-43cb-b6fe-ceb5a49c9b51","resolution":{"observed_at":"2026-08-12T20:22:44.355889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.333591Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"df1527b7-bb8d-489a-aa64-0d562e1d120e","year":2009},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.645152Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:4cd177c92a9f2d537c2faf9a958f54e302dedadf3498ce5a839c8c692c5ab9dd","observation_id":"14b3eee8-e4a9-422d-9271-e353dad14a6c","resolution":{"observed_at":"2026-08-12T20:22:44.339486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13547","last_updated":"2023-12-21T03:11:30Z","snapshot_observed_at":"2026-08-13T04:57:09.354122Z","submitted_at":"2023-12-21T03:11:30Z","title":"How to Prune Your Language Model: Recovering Accuracy on the \"Sparsity May Cry'' Benchmark","version":1},"cited_work":{"arxiv_id":"2312.13547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.13547","snapshot_observed_at":"2026-08-12T20:22:44.027747Z","title":"How to Prune Your Language Model: Recovering Accuracy on the \"Sparsity May Cry'' Benchmark","venue":"cs.CL","work_id":"1a1a502f-d510-4e80-bed2-0875bdc07acb","year":2023},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.649754Z"},"links":{"cited_paper":"/paper/2312.13547","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:8ae989d5ab274ee989e645f6af7ae7cf2eb72e8846dd36a1587cce4652d08648","observation_id":"51f52843-8c2e-4dbe-b511-552794a52e3d","resolution":{"observed_at":"2026-08-12T20:22:44.033760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-12T20:22:43.654544Z","title":"Albert: A lite bert for self-supervised learning of language representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.654544Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:c6e2821d9415208a06fb295a974c8c3be4f5622d83aae90d2206a22a65686ed3","observation_id":"de662480-cb61-4903-bffa-aca07558fcf3","resolution":{"observed_at":"2026-08-12T20:22:43.654544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.316235Z","title":"Sparsimony - Dynamic sparse training and pruning algorithms for PyTorch , September 2024","venue":null,"work_id":"5c9dc500-e7df-41a9-9c85-589b6ef24701","year":2024},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.659338Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:5566cf28e307b8c21932c864595ee2646e0931f7e251b990a049c851f885015e","observation_id":"5a2fa996-9948-4676-a588-e5313b11e4c5","resolution":{"observed_at":"2026-08-12T20:22:44.321665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09380","last_updated":"2023-06-15T10:48:59Z","snapshot_observed_at":"2026-08-14T16:41:22.423775Z","submitted_at":"2023-06-15T10:48:59Z","title":"Understanding Parameter Sharing in Transformers","version":1},"cited_work":{"arxiv_id":"2306.09380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09380","snapshot_observed_at":"2026-08-12T20:22:43.982609Z","title":"Understanding Parameter Sharing in Transformers","venue":"cs.LG","work_id":"6c09080a-d9e6-4fa5-8754-98118582db1a","year":2023},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.664101Z"},"links":{"cited_paper":"/paper/2306.09380","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:9d4accd120cc87125e05c44f0ef7e1ea3bb72c83d068da5b09407b8f0d7529bc","observation_id":"c1ea1891-a5b5-4edf-a6e8-e199a2a1aa16","resolution":{"observed_at":"2026-08-12T20:22:43.988861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-12T20:22:43.669217Z","title":"Dora: Weight-decomposed low-rank adaptation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.669217Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:b3eba2ece63cfa8ef5b82d51569f91226ce0d986bc315c35248c2f09af8d817e","observation_id":"34c55d3a-a5eb-418d-9a41-9beb0698d0d9","resolution":{"observed_at":"2026-08-12T20:22:43.669217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-13T19:24:14.214828Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14030","snapshot_observed_at":"2026-08-12T20:22:43.674605Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.674605Z"},"links":{"cited_paper":"/paper/2103.14030","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:1b430e57804278b481024a02a741879eeebcef204e74749ee8602b0cbf378a88","observation_id":"f6da22c0-ce54-4f5b-91e4-de9fe7f87927","resolution":{"observed_at":"2026-08-12T20:22:43.674605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T20:22:43.679565Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.679565Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:31c6d123c57c024fc2b3a373cd4645d5773c16c6d8dfe8612e010686cfd2d2f8","observation_id":"c47bc98a-4294-424e-b03b-6fcec270f449","resolution":{"observed_at":"2026-08-12T20:22:43.679565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.298752Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"3295f0b8-5967-45a4-a818-431f136f6cd9","year":2008},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.684577Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:8fdb3e3610427a458d64299a5a0f6d42b110b16551c52912b644a1d3cc054db0","observation_id":"812f61f9-2dc6-48d7-b666-408f2a44803a","resolution":{"observed_at":"2026-08-12T20:22:44.304112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.06631","last_updated":"2021-07-13T17:34:09Z","snapshot_observed_at":"2026-08-11T15:27:23.588671Z","submitted_at":"2020-07-13T19:03:22Z","title":"T-Basis: a Compact Representation for Neural Networks","version":2},"cited_work":{"arxiv_id":"2007.06631","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.06631","snapshot_observed_at":"2026-08-12T20:22:43.908304Z","title":"T-Basis: a Compact Representation for Neural Networks","venue":"cs.LG","work_id":"fa97129e-29a0-4504-864a-b02909a82e88","year":2020},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.689252Z"},"links":{"cited_paper":"/paper/2007.06631","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:4329545d334466ccda86723e98dce4bcb8359c2b7f0a01c5707dfa99359de2df","observation_id":"c1efe49d-dcfa-4bb5-ba4f-99037eea87af","resolution":{"observed_at":"2026-08-12T20:22:43.913887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.283023Z","title":"Parkhi, Andrea Vedaldi, Andrew Zisserman, and C","venue":null,"work_id":"cfc0dad0-b836-42cf-ac4a-5d2ac0e5d2ab","year":2012},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.694254Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:c75d9fcb61ca0d6b93b8d23f468b2cb0c3a5bca26181143c57bfc664a12e1271","observation_id":"6db621c8-fb4d-4236-acce-d22837245a10","resolution":{"observed_at":"2026-08-12T20:22:44.288041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/eurospeech.1997-708","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:43.802866Z","title":"Sparse connection and pruning in large dynamic artificial neural networks","venue":null,"work_id":"78de083b-812b-4aaf-bb23-b7a5e297f9da","year":1997},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.698878Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:5fada6d667f8c3a704e1a71ec469f02c40e4f18449699c87e215147901e437f8","observation_id":"1f964222-0bc8-4cfb-9c90-75f773ae2d58","resolution":{"observed_at":"2026-08-12T20:22:43.811008Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06022","last_updated":"2023-06-02T11:10:25Z","snapshot_observed_at":"2026-08-13T19:40:45.326012Z","submitted_at":"2021-04-13T08:41:07Z","title":"Lessons on Parameter Sharing across Layers in Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06022","snapshot_observed_at":"2026-08-12T20:22:43.703453Z","title":"Lessons on parameter sharing across layers in transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.703453Z"},"links":{"cited_paper":"/paper/2104.06022","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:61dd37c7d636f44e19b8f31ddbffbe9d877e0ad0982f442f3a0cb9e6c945c675","observation_id":"0514b807-86cc-46dc-86f9-33fae85a10c0","resolution":{"observed_at":"2026-08-12T20:22:43.703453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.266383Z","title":"Evaluating pruning methods","venue":null,"work_id":"72e915a2-b04e-4cfa-a374-7a894c8197a0","year":1995},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.708207Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:d197b1e169880f68e2aec63620bc23e87ed484d508b7e00ca7af850f0a26df62","observation_id":"34469cd8-71c0-46a0-b630-9aa024448a12","resolution":{"observed_at":"2026-08-12T20:22:44.271722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12877","last_updated":"2021-01-15T15:52:50Z","snapshot_observed_at":"2026-08-14T15:24:34.572038Z","submitted_at":"2020-12-23T18:42:10Z","title":"Training data-efficient image transformers & distillation through attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12877","snapshot_observed_at":"2026-08-12T20:22:43.713022Z","title":"Training data-efficient image transformers & distillation through attention, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.713022Z"},"links":{"cited_paper":"/paper/2012.12877","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:916f356134c7a9788003fb739c5560461fe9e3cc6826fc4c909cc5cdcfdd673b","observation_id":"f25f8c44-c7ce-4b9f-9c53-7e0faf883d84","resolution":{"observed_at":"2026-08-12T20:22:43.713022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:44.248807Z","title":"The inaturalist species classification and detection dataset","venue":null,"work_id":"a5206944-706c-454a-badd-aa829ac6d56c","year":2018},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.717936Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:8570a32c10a824af00c3dbc5a7e0e33856146bc1df3609b13ebee63ef2166fc0","observation_id":"9c24d074-f376-41af-937b-5aed07532676","resolution":{"observed_at":"2026-08-12T20:22:44.254909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:43.722447Z","title":"Compressingtransformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.722447Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:59c19b8879685c9e5df7e76bfc7643a19a307dcd127574eba4bc0672ce919d75","observation_id":"6b8804e1-98c4-4cdc-ba84-69cb17404e39","resolution":{"observed_at":"2026-08-12T20:22:43.722447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07154","last_updated":"2022-04-14T17:59:05Z","snapshot_observed_at":"2026-08-13T16:02:11.118062Z","submitted_at":"2022-04-14T17:59:05Z","title":"MiniViT: Compressing Vision Transformers with Weight Multiplexing","version":1},"cited_work":{"arxiv_id":"2204.07154","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.07154","snapshot_observed_at":"2026-08-12T20:22:43.846351Z","title":"MiniViT: Compressing Vision Transformers with Weight Multiplexing","venue":"cs.CV","work_id":"1b03c332-77af-47bb-886f-ea8d66ded1e9","year":2022},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.727371Z"},"links":{"cited_paper":"/paper/2204.07154","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:a0af0e42191c937d9ea1bc6735cd2286e7a0f05f217f4e2bfad95bbc93c2e05a","observation_id":"2cc2282b-f96c-40ec-91e3-e0d341cb143a","resolution":{"observed_at":"2026-08-12T20:22:43.852292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.01878","last_updated":"2017-11-13T18:40:16Z","snapshot_observed_at":"2026-08-15T03:14:52.303459Z","submitted_at":"2017-10-05T04:26:49Z","title":"To prune, or not to prune: exploring the efficacy of pruning for model compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.01878","snapshot_observed_at":"2026-08-12T20:22:43.732391Z","title":"To prune, or not to prune: exploring the efficacy of pruning for model compression, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.732391Z"},"links":{"cited_paper":"/paper/1710.01878","citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:6d1bdb29ee9c34bc4dda22d4738b1c1f19e5348caf3efc932255d2122ce50ee8","observation_id":"2aa859b4-d1af-48b6-ba11-97036191c7ba","resolution":{"observed_at":"2026-08-12T20:22:43.732391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:43.737295Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.737295Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:4ef9b4b106538829e19d1dd71623af14328f9ebb3b9c360903e8d2e67d35ae88","observation_id":"fe20b7c7-4c54-4449-be7e-363869e2474a","resolution":{"observed_at":"2026-08-12T20:22:43.737295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:43.742874Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.742874Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:2c795782efef6ebc4de962a45954ac36e0cd4bfa0d69bd6913b85256111b7c22","observation_id":"21d0a1d5-a6b6-418f-9106-6d448c17ec4d","resolution":{"observed_at":"2026-08-12T20:22:43.742874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:43.748122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.748122Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:033103b5acc0e43560f2601c95da41967904556ce03c5a2a1abdb52b15a711cc","observation_id":"c1b41873-cfae-44c2-a9f4-e74770a2614d","resolution":{"observed_at":"2026-08-12T20:22:43.748122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:22:43.753540Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition","version":6},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T20:22:43.753540Z"},"links":{"citing_paper":"/paper/2411.09816"},"observation_digest":"sha256:61af1e039e48c51579a96803622de7011e62741e1630eb1941d74beeffe0f0db","observation_id":"263fec75-f46d-48f6-a7ac-19f0e6969c05","resolution":{"observed_at":"2026-08-12T20:22:43.753540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.09816","last_updated":"2026-06-07T15:25:09Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T08:23:15.724415Z","submitted_at":"2024-11-14T21:29:58Z","title":"Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":6,"verified_fuzzy":9},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2411.09816."}