{"as_of":"2026-08-10T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1cf40ea7fd68a21a86e510eab56e9002a059edfbbe0fc331b12e57a4a977529c","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:42:41.436411Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:11:11.608849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T19:43:54.739687Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00258","snapshot_observed_at":"2026-08-06T05:11:11.608849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.608849Z"},"links":{"cited_paper":"/paper/2502.00258","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:1a733d286b71a5037e442dd992a1a1b935b062b17329768b9b98b3bf8fb9e331","observation_id":"0be974c8-6aeb-439d-91d4-c5c3dc03f558","resolution":{"observed_at":"2026-08-06T05:11:11.608849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"cited_work":{"arxiv_id":"2502.00258","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00258","snapshot_observed_at":"2026-06-29T19:43:54.739687Z","title":"Proxsparse: Regularized learning of semi-structured sparsity masks for pretrained llms.arXiv preprint arXiv:2502.00258, 2025","venue":null,"work_id":"06744dfb-7906-4b16-9c28-c14b8fd81424","year":2025},"citing_paper":{"arxiv_id":"2605.26632","last_updated":"2026-06-01T03:03:29Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T07:09:49Z","title":"RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T19:40:42.033793Z"},"links":{"cited_paper":"/paper/2502.00258","citing_paper":"/paper/2605.26632"},"observation_digest":"sha256:b63e26c3755a765222f94accf32bc8cc6be1355aeb52b396233d8a83d7bbef8a","observation_id":"bc604385-c1a5-4de3-a336-b774be362aaf","resolution":{"observed_at":"2026-06-29T19:43:54.741286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00258/citation-record","integrity":"/paper/2502.00258/integrity","json":"/paper/2502.00258/citation-record.json","paper":"/paper/2502.00258"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T19:42:41.320977Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.320977Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:a7698c2f2afa29bfd5d58d6bab9a4eb7809f2f9bc810e8ccd6c91436babfbe51","observation_id":"3f9964df-3505-42d3-892a-ae80afcac4bc","resolution":{"observed_at":"2026-08-09T19:42:41.320977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17946","last_updated":"2024-10-31T19:38:15Z","snapshot_observed_at":"2026-08-08T06:24:59.604989Z","submitted_at":"2024-02-28T00:09:07Z","title":"SparseLLM: Towards Global Pruning for Pre-trained Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17946","snapshot_observed_at":"2026-08-09T19:42:41.325205Z","title":"Sparsellm: Towards global pruning for pre-trained language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.325205Z"},"links":{"cited_paper":"/paper/2402.17946","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:f72fb99b8572f18f89a7c2c3321e95c3eb6c94b8a073352b5587101dad999feb","observation_id":"253557ed-d3e7-4ed1-a25c-9d5abc623298","resolution":{"observed_at":"2026-08-09T19:42:41.325205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.907329Z","title":"An alternating semiproximal method for nonconvex regularized structured total least squares problems","venue":null,"work_id":"31803b3b-ebf0-46d8-a341-77eff859b7d6","year":2016},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.329132Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:d9034d21717a60b061e74f0b23c56f047c0c06155c76c3cd63543371d6e76736","observation_id":"df56ab46-4de8-44a0-8f8b-4acfaaa54c8e","resolution":{"observed_at":"2026-08-09T19:42:41.911100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-09T19:42:41.332725Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.332725Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:a9a97c0a11f16ec274c2da4ddbcfdc8207cb3427b3fce761e60c64f380cdffcb","observation_id":"d1713432-1100-4da2-aabc-013101b18181","resolution":{"observed_at":"2026-08-09T19:42:41.332725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02938","last_updated":"2024-07-22T14:34:04Z","snapshot_observed_at":"2026-08-10T00:55:54.783372Z","submitted_at":"2024-01-01T23:10:23Z","title":"Fast and Effective Weight Update for Pruned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02938","snapshot_observed_at":"2026-08-09T19:42:41.336372Z","title":"Fast and effective weight update for pruned large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.336372Z"},"links":{"cited_paper":"/paper/2401.02938","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:64a9c0753bd033c043f5aae3038476b713409bd87955432c7e2e22f89175c62f","observation_id":"e1b76240-4ede-4dc1-a59b-83659f64b14d","resolution":{"observed_at":"2026-08-09T19:42:41.336372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18700","last_updated":"2024-04-02T02:38:31Z","snapshot_observed_at":"2026-07-06T17:37:05.339368Z","submitted_at":"2024-02-28T20:41:21Z","title":"Learning to Compress Prompt in Natural Language Formats","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18700","snapshot_observed_at":"2026-08-09T19:42:41.340018Z","title":"Learning to compress prompt in natural language formats, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.340018Z"},"links":{"cited_paper":"/paper/2402.18700","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:a8c0a050922563988d466a99cc6fa0339d7112f43a3f8514d7a8a87b2520b4ef","observation_id":"ccdbf154-5339-4e6d-b0b5-a65657cc3cad","resolution":{"observed_at":"2026-08-09T19:42:41.340018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.896983Z","title":"A dynamic alternating direction of multipliers for nonconvex minimization with nonlinear functional equality constraints","venue":null,"work_id":"ca391293-c974-49a2-9f1b-dd8e95619a0f","year":2022},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.343614Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:5adc042cfd9ac74693f41d25dc0ca7e0dfbfc4ac4079087ac36f09e13af0517a","observation_id":"f575af71-2dfe-4dc6-a8d2-756ed6b24928","resolution":{"observed_at":"2026-08-09T19:42:41.900793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17481","last_updated":"2024-12-07T12:01:28Z","snapshot_observed_at":"2026-08-04T12:55:07.134932Z","submitted_at":"2024-09-26T02:37:41Z","title":"MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17481","snapshot_observed_at":"2026-08-09T19:42:41.346481Z","title":"Maskllm: Learnable semi-structured sparsity for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.346481Z"},"links":{"cited_paper":"/paper/2409.17481","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:7ee7fe583994e8d68d14f770c5edd2e1c0a983a7553c6da1f8a4c2dfa3138886","observation_id":"3700b71c-0215-44a9-b085-19273f1a5b60","resolution":{"observed_at":"2026-08-09T19:42:41.346481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-09T19:42:41.350141Z","title":"and Carbin, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.350141Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:bd32cc66f9e90ed7a529ae8b9e89f8216c9a4be550c5ebfaf172aff12df9f622","observation_id":"b597e834-ba66-4edb-8982-2db50856558a","resolution":{"observed_at":"2026-08-09T19:42:41.350141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.353297Z","title":"and Alistarh, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.353297Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:f22c5f503e58e11c8ad9082d69d93da155aa8ff5dc1a0c4a5bb6007857fe099e","observation_id":"658b4c75-0a12-4fa3-9ad3-459d0d96bf87","resolution":{"observed_at":"2026-08-09T19:42:41.353297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-09T19:42:41.356415Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.356415Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:0591207c5a2ecd343d4a2153575702ba436413a127ccb79eddc8da81afcced76","observation_id":"c89fcf7d-9685-4d24-937c-d8037712e7fd","resolution":{"observed_at":"2026-08-09T19:42:41.356415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.359779Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.359779Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:972bdbd35be34939ebd765bffb4489930cd94b1c73f763cc3acab3fb168e7351","observation_id":"f26e591d-0398-47d8-9ec9-f947f2d4bed8","resolution":{"observed_at":"2026-08-09T19:42:41.359779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.881654Z","title":"and Liu, H","venue":null,"work_id":"1cf05b06-1c0d-4fd9-b494-489e65c0c5ef","year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.362436Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:5f4fff58e5ab3e8447ea8eba901bcbc4ff5141917a9f88ce175c435370f9ad83","observation_id":"56f288a4-ef20-4630-a8b4-ff32327854e5","resolution":{"observed_at":"2026-08-09T19:42:41.885648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.00149","last_updated":"2016-02-15T06:25:40Z","snapshot_observed_at":"2026-08-04T16:59:47.843960Z","submitted_at":"2015-10-01T09:03:44Z","title":"Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.00149","snapshot_observed_at":"2026-08-09T19:42:41.364914Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.364914Z"},"links":{"cited_paper":"/paper/1510.00149","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:1bf55f689024869d8e5ccff197d622814d51e54145a2873c1a1b8272661febb6","observation_id":"01bda5a5-6cf9-4fed-a601-a30798fd6bfb","resolution":{"observed_at":"2026-08-09T19:42:41.364914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20584","last_updated":"2024-12-18T07:14:33Z","snapshot_observed_at":"2026-08-08T01:30:48.726185Z","submitted_at":"2024-07-30T06:33:44Z","title":"Pruning Large Language Models with Semi-Structural Adaptive Sparse Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20584","snapshot_observed_at":"2026-08-09T19:42:41.367419Z","title":"Pruning large language models with semi-structural adaptive sparse training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.367419Z"},"links":{"cited_paper":"/paper/2407.20584","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:7acbfa5a404eda9a586027d17a50a0eefca97875d864359b1c6368a31ba81d34","observation_id":"49b2e97c-55b7-4db2-80f9-d92deb7ad163","resolution":{"observed_at":"2026-08-09T19:42:41.367419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T19:42:41.370326Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.370326Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:6e3bf4534b2cf5f49c26fc74398701fda02a1b6ffc4c9ef7c76e14d4e93e31b2","observation_id":"cebb6e6a-e211-4a42-b8a9-a7f9ddba8145","resolution":{"observed_at":"2026-08-09T19:42:41.370326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18015","last_updated":"2025-01-29T22:05:17Z","snapshot_observed_at":"2026-08-10T00:57:10.964759Z","submitted_at":"2025-01-29T22:05:17Z","title":"A Proximal Operator for Inducing 2:4-Sparsity","version":1},"cited_work":{"arxiv_id":"2501.18015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.18015","snapshot_observed_at":"2026-08-09T19:42:41.567040Z","title":"A Proximal Operator for Inducing 2:4-Sparsity","venue":"cs.LG","work_id":"4302b15d-1084-4f57-8851-623e75101f83","year":2025},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.373210Z"},"links":{"cited_paper":"/paper/2501.18015","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:0413186ad752a34f1611a7440c972af075f36d59490fa22e55763a4fb042ae6e","observation_id":"aeb551ff-4283-4734-a769-abe0cf0bea30","resolution":{"observed_at":"2026-08-09T19:42:41.571845Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.375936Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.375936Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:e7ecfd1ebeb570ed2562baa2318c0cff202b89aca61b301f70c1f76b62ac3b46","observation_id":"3ad03afe-0e68-4d58-8e6a-bacf4476db92","resolution":{"observed_at":"2026-08-09T19:42:41.375936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-09T19:42:41.378889Z","title":"F., Cheng, K.-T., and Chen, M.-H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.378889Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:ee3dcdb1fb9a905de70912329f0c661ebc149de8de3a2ecb07be7ea53c7d9e40","observation_id":"22863de5-7164-4ea7-899e-17076d693d1b","resolution":{"observed_at":"2026-08-09T19:42:41.378889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.382027Z","title":"W., and Yang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.382027Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:52f05d9e0a4206bf298969c7ec8a2de381d519188b2ff992bc1ec023d6d7e924","observation_id":"45009686-45be-44c0-9249-0908a0766ed3","resolution":{"observed_at":"2026-08-09T19:42:41.382027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.384613Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.384613Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:add54517cbe2be0b550d30f4574b3757e44403d2e41e47cc52e45beb793de38f","observation_id":"a9cd3484-91b1-4af1-9f1b-3ae6a894aa5d","resolution":{"observed_at":"2026-08-09T19:42:41.384613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.387579Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.387579Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:5346a07b0d385b3bc96e080609e6e12067e86283b0bd29e16fa889e0dfb46706","observation_id":"57e62e8d-2069-453a-8747-ba3fc2001847","resolution":{"observed_at":"2026-08-09T19:42:41.387579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-09T17:51:25.854845Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-09T19:42:41.390434Z","title":"A., Pool, J., Stosic, D., Stosic, D., Venkatesh, G., Yu, C., and Micikevicius, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.390434Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:7912f922e7be07d09382d8101fd516018e2db5ae3959057550a4ce24e4f22bb3","observation_id":"77302a96-31b4-4366-8dcc-7e2ae682391f","resolution":{"observed_at":"2026-08-09T19:42:41.390434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.850865Z","title":"Gradient methods for minimizing composite functions","venue":null,"work_id":"b305fa08-6c1e-4dd7-802d-e65c76fee044","year":2013},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.393100Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:c74b5b3d746fd2862e191ebcc84d384e4fbc84e09f6a0ffe474f63f64cfdff27","observation_id":"bae2b174-b52a-41c9-b199-41304c822df0","resolution":{"observed_at":"2026-08-09T19:42:41.854868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20566","last_updated":"2025-02-27T22:08:08Z","snapshot_observed_at":"2026-08-07T17:41:31.923537Z","submitted_at":"2025-02-27T22:08:08Z","title":"Stochastic Rounding for LLM Training: Theory and Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20566","snapshot_observed_at":"2026-08-09T19:42:41.395993Z","title":"Stochastic rounding for llm training: Theory and practice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.395993Z"},"links":{"cited_paper":"/paper/2502.20566","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:012051fa7cd2ec30d2c43c0e5f47715160a7da4f4078ca2a26e312c60d2efc1b","observation_id":"a559ffa1-4e47-4db3-840d-2e45b931d216","resolution":{"observed_at":"2026-08-09T19:42:41.395993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.399410Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.399410Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:c415dcfaf368e8be6b2fdc6928c998fdab6ea24c390f0d08b0e2103c59ad8be1","observation_id":"2d350950-1f86-45e8-afd7-90f6f397e214","resolution":{"observed_at":"2026-08-09T19:42:41.399410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.835324Z","title":null,"venue":null,"work_id":"4220a6de-9fda-4004-9b0e-fc71c60f8fbb","year":1998},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.402214Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:0230a84307f995fef87bde74abef9a787be7c7adbd8f9a13704958a101632f80","observation_id":"232cb4d1-bd75-45bc-a3cc-83f037f3b931","resolution":{"observed_at":"2026-08-09T19:42:41.839029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-09T19:42:41.404912Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.404912Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:7c577fb298a7efeba9ccad47680775f2d696943191591cbecd624163636a632f","observation_id":"f02067e2-a6cb-4fd7-af34-e2d03860a793","resolution":{"observed_at":"2026-08-09T19:42:41.404912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-09T19:42:41.408512Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.408512Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:c0ab1634c1815c605c8b3f064cf1360698e42a3ed42045b3b989c31724abdf0d","observation_id":"d7038abe-4d9f-42b6-be13-7b5c08d2c740","resolution":{"observed_at":"2026-08-09T19:42:41.408512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-09T19:42:41.411926Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.411926Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:d416b614614c7ed1128cf07c9422ff6571691b2048d8c4381d0e2f7e4e1587f7","observation_id":"316a731c-8346-4f01-8e9c-b7ca6d64b8d3","resolution":{"observed_at":"2026-08-09T19:42:41.411926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20586","last_updated":"2025-08-26T23:08:09Z","snapshot_observed_at":"2026-08-10T09:02:33.487997Z","submitted_at":"2025-02-27T23:01:31Z","title":"Training LLMs with MXFP4","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20586","snapshot_observed_at":"2026-08-09T19:42:41.415287Z","title":"Training llms with mxfp4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.415287Z"},"links":{"cited_paper":"/paper/2502.20586","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:c12d37453908649e59eaceafe1dcf636de10bbbb10f0ef89d84f667857d3a327","observation_id":"2135b4e7-81a8-42d8-8f41-5321d983ab34","resolution":{"observed_at":"2026-08-09T19:42:41.415287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-09T19:42:41.418279Z","title":"Emergent abilities of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.418279Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:e9915e04c6c4e162019585ca81d5d00e7ae6677b54b34ce8dc17f7eebc90c649","observation_id":"a78d1c00-a2b7-4aa7-8d85-47157c92ea8b","resolution":{"observed_at":"2026-08-09T19:42:41.418279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09003","last_updated":"2025-06-06T02:29:18Z","snapshot_observed_at":"2026-08-09T10:27:15.269103Z","submitted_at":"2025-02-13T06:44:33Z","title":"RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09003","snapshot_observed_at":"2026-08-09T19:42:41.421127Z","title":"K., Kang, D., Park, Y., and Hong, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.421127Z"},"links":{"cited_paper":"/paper/2502.09003","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:98245513eb76678e376a5e763fb56cf97abfd7c2847b61f315688a60c55aee22","observation_id":"273f1c42-f69e-4b2a-85de-c71a14c63435","resolution":{"observed_at":"2026-08-09T19:42:41.421127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-09T19:42:41.424152Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.424152Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:b211bc8f8f5efae30e07b8b1a6f0aa4d5702d929eeaa0285d8d97c5f73421394","observation_id":"77a8b4ed-8efe-4c36-ac5b-ee025772108e","resolution":{"observed_at":"2026-08-09T19:42:41.424152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-09T19:42:41.427558Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.427558Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:daed9aa1aed47e3aa2694dcac85c3f562b36647a0f15dff6c5e8502c792c43a2","observation_id":"e9dd8a23-4299-48cb-917d-ba5dba53a982","resolution":{"observed_at":"2026-08-09T19:42:41.427558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05175","last_updated":"2025-06-30T22:16:39Z","snapshot_observed_at":"2026-08-01T08:08:15.221032Z","submitted_at":"2023-10-08T14:22:58Z","title":"Outlier Weighed Layerwise Sparsity (OWL): A Missing Secret Sauce for Pruning LLMs to High Sparsity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05175","snapshot_observed_at":"2026-08-09T19:42:41.430360Z","title":"Outlier weighed layerwise sparsity (owl): A missing secret sauce for pruning llms to high sparsity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.430360Z"},"links":{"cited_paper":"/paper/2310.05175","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:9a42e27e2816ecda0abc348056fdea1b8b8f427c91e934856648fd5f5ab7f4f3","observation_id":"ed13a50e-67c2-4b94-b76c-a7dbe3d16b68","resolution":{"observed_at":"2026-08-09T19:42:41.430360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01527","last_updated":"2024-10-08T19:34:03Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:59:47Z","title":"KV Cache Compression, But What Must We Give in Return? A Comprehensive Benchmark of Long Context Capable Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01527","snapshot_observed_at":"2026-08-09T19:42:41.433628Z","title":"Kv cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.433628Z"},"links":{"cited_paper":"/paper/2407.01527","citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:c4c8ea72b392a5eaac8c941154859f37d491574f917bd060b65e2a1f437d1de2","observation_id":"3fee9afb-2407-4e3f-9155-b9a192ac264e","resolution":{"observed_at":"2026-08-09T19:42:41.433628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:42:41.436411Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T19:42:41.436411Z"},"links":{"citing_paper":"/paper/2502.00258"},"observation_digest":"sha256:cbd016096ab6b5f54d1223781820449fc62a4ee523c1765a375fc5b84265e57c","observation_id":"e22cf1e7-2f02-4f57-bd4c-72bd889c4f7f","resolution":{"observed_at":"2026-08-09T19:42:41.436411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2502.00258."}