{"as_of":"2026-08-15T20:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2daa060327333d497d0e53466ec9df9552f75414065a62a6e72311d106bc6c6","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:13:55.350447Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:49:18.173939Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2411.17426","doi":"10.48550/arxiv.2411.17426","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"2a3e13f7-1cdd-4cb8-a150-4879953b4073","year":2025},"citing_paper":{"arxiv_id":"2605.09515","last_updated":"2026-05-10T12:51:59Z","snapshot_observed_at":"2026-08-11T17:45:04.355983Z","submitted_at":"2026-05-10T12:51:59Z","title":"A Game Theoretic Free Energy Analysis of Higher Order Synergy in Attention Heads of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T03:49:18.173939Z"},"links":{"cited_paper":"/paper/2411.17426","citing_paper":"/paper/2605.09515"},"observation_digest":"sha256:e70e943e34c28040ad41b5bad25f9c350ec47c63c1c6e1076b912ca449cff9aa","observation_id":"ae8f960e-e435-4def-9d83-e29d039d6d53","resolution":{"observed_at":"2026-05-12T03:51:19.728655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17426/citation-record","integrity":"/paper/2411.17426/integrity","json":"/paper/2411.17426/citation-record.json","paper":"/paper/2411.17426"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-12T12:13:55.118677Z","title":"J., Javaheripi, M., Kauffmann, P., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.118677Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:443c0cf3ef8d035a70fe56c2b7a30234b14496850a244075ae08482207116a1f","observation_id":"94ae2224-f413-47c8-b03c-e30bbcb817fb","resolution":{"observed_at":"2026-08-12T12:13:55.118677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-12T12:13:55.131779Z","title":"Ainslie, J., Lee-Thorp, J., de Jong, M., Zemlyanskiy, Y ., Lebr´on, F., and Sanghai, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.131779Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:0242afb470991e912b7311eee073a830943f11f7c7c16a270432c44d5da38e81","observation_id":"939f3533-6a90-453f-b5e1-ad3e538ccc18","resolution":{"observed_at":"2026-08-12T12:13:55.131779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11961","last_updated":"2022-12-01T18:31:43Z","snapshot_observed_at":"2026-08-13T15:38:09.836605Z","submitted_at":"2022-05-24T10:48:33Z","title":"ATTEMPT: Parameter-Efficient Multi-task Tuning via Attentional Mixtures of Soft Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11961","snapshot_observed_at":"2026-08-12T12:13:55.140149Z","title":"anthropic.com/news/claude-3-5-sonnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.140149Z"},"links":{"cited_paper":"/paper/2205.11961","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:792d5bc90690a71ffea230d571637d7757bf01e9446b1af5698920bbb8a2ef5a","observation_id":"03ed4dc3-d83b-4793-af30-70b4c2134d6b","resolution":{"observed_at":"2026-08-12T12:13:55.140149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:55.154139Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.154139Z"},"links":{"citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:37978961436226dc54557548ce6e92fea93608210986ee0fe3d91129ac87d91b","observation_id":"b8618e0a-7d68-4ce0-a1ce-951f534da253","resolution":{"observed_at":"2026-08-12T12:13:55.154139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T12:13:55.127736Z","title":"URL https://doi.org/ 10.48550/arXiv.2307.09288","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.127736Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:d1fca55cbb3197be992b3e7dc0732ed4eccc582613609300d2f559ae46ee1cdf","observation_id":"c58bd6b0-214b-406c-9126-2631c6f62248","resolution":{"observed_at":"2026-08-12T12:13:55.127736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07143","last_updated":"2024-07-13T14:20:07Z","snapshot_observed_at":"2026-08-13T13:22:14.530063Z","submitted_at":"2022-12-14T10:24:50Z","title":"Reproducible scaling laws for contrastive language-image learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07143","snapshot_observed_at":"2026-08-12T12:13:55.158701Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.158701Z"},"links":{"cited_paper":"/paper/2212.07143","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:e78c4d0f99c006fcae1348e6d4c5c0fbe6a4b4c657c0ad440f1b4fd0494ac171","observation_id":"a06b8540-cd2b-4cf5-ae83-42f9b05ebd21","resolution":{"observed_at":"2026-08-12T12:13:55.158701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-12T12:13:55.162705Z","title":"Boolq: Exploring the surpris- ing difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.162705Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:c10eb8c42d71bf313c7a83aa2e54c929d976c9cfeb9e1d8ccf670fdddd63a5b3","observation_id":"2b283e41-b2fe-4436-99c0-8c1b9d840ee4","resolution":{"observed_at":"2026-08-12T12:13:55.162705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T12:13:55.179499Z","title":"48550/arXiv.2405.04434","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.179499Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:82b82b8f1c1eb1a075184768e36b19aaebd3dcf9f6cad823ce4923f72fe60a94","observation_id":"ced3d7ac-354d-4ae5-8102-0cd4742e08dd","resolution":{"observed_at":"2026-08-12T12:13:55.179499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-12T12:13:55.183663Z","title":"Gptq: Accurate post-training quantization for generative pre- trained transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.183663Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:4141e066f6331ef3bcfbe6040ba3373ad80deedd55a946210ee2b646777e35bb","observation_id":"0861081f-5135-45b7-ab91-8303610ce173","resolution":{"observed_at":"2026-08-12T12:13:55.183663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-08-14T16:48:56.338904Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-08-12T12:13:55.187485Z","title":"Lazyllm: Dynamic token pruning for efficient long context llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.187485Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:ab33babc251f7eb7b322ca2f32bfb72f4228c8d8aca7e4f443e8fa3efb0c19b5","observation_id":"b58ca8af-8e8a-47d0-b4fc-e6a66fc6ec52","resolution":{"observed_at":"2026-08-12T12:13:55.187485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T12:13:55.197342Z","title":"and Dao, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.197342Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:8ebc2f01080d463e1ccc4815393f9835659f4edc3bdaf32fccf8953395a3e38c","observation_id":"3e02b31b-5f48-4c1e-b1e9-c8a2ca0c7c7f","resolution":{"observed_at":"2026-08-12T12:13:55.197342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07463","last_updated":"2021-06-09T14:39:17Z","snapshot_observed_at":"2026-08-14T01:45:49.828899Z","submitted_at":"2020-12-14T12:34:01Z","title":"Parameter-Efficient Transfer Learning with Diff Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07463","snapshot_observed_at":"2026-08-12T12:13:55.201088Z","title":"M., and Kim, Y","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.201088Z"},"links":{"cited_paper":"/paper/2012.07463","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:3c5be75f2cc3073d3a1090ddbe75086346ce16c7bb1f7b12f7528294e747ef46","observation_id":"929250b8-7d16-4f18-a628-02e444a1a923","resolution":{"observed_at":"2026-08-12T12:13:55.201088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05015","last_updated":"2023-10-11T01:46:35Z","snapshot_observed_at":"2026-08-13T05:54:40.622925Z","submitted_at":"2023-10-08T05:16:28Z","title":"Compresso: Structured Pruning with Collaborative Prompting Learns Compact Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05015","snapshot_observed_at":"2026-08-12T12:13:55.205222Z","title":"L., and Yang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.205222Z"},"links":{"cited_paper":"/paper/2310.05015","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:7d41b037012392652c7d79ebec087cf7900ee8694b92ed4e7d589504e0ecb1ca","observation_id":"d57e66d5-ab66-4375-a10a-9026e95707f9","resolution":{"observed_at":"2026-08-12T12:13:55.205222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00121","last_updated":"2021-06-02T13:13:01Z","snapshot_observed_at":"2026-08-10T06:13:20.678193Z","submitted_at":"2021-01-01T00:41:03Z","title":"WARP: Word-level Adversarial ReProgramming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00121","snapshot_observed_at":"2026-08-12T12:13:55.209254Z","title":"Warp: Word-level adversarial reprogramming","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.209254Z"},"links":{"cited_paper":"/paper/2101.00121","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:c2b5d8ca400998a7114df94175bb8f318f5579a990093897ac34af5dc9302e01","observation_id":"c2407cda-9fed-47bd-8506-aa1e49ebb98b","resolution":{"observed_at":"2026-08-12T12:13:55.209254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T12:13:55.216750Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.216750Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:a8f7a3f8661d689830edca15f8b172e0eb75ff45853949d3ac81fbd972dae9d9","observation_id":"e7c08225-ea0f-443a-831a-3ce08e08557d","resolution":{"observed_at":"2026-08-12T12:13:55.216750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12130","last_updated":"2024-05-20T15:48:32Z","snapshot_observed_at":"2026-08-13T00:03:41.650359Z","submitted_at":"2024-05-20T15:48:32Z","title":"MoRA: High-Rank Updating for Parameter-Efficient Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12130","snapshot_observed_at":"2026-08-12T12:13:55.220785Z","title":"Mora: High-rank updating for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.220785Z"},"links":{"cited_paper":"/paper/2405.12130","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:5b335ddf36f04c5dd1c887eb6f4bb128700973a65ca052f508c63689dc807255","observation_id":"c3d855c0-f8a4-4e2e-8759-7b3d1a4db797","resolution":{"observed_at":"2026-08-12T12:13:55.220785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20485","last_updated":"2024-07-31T02:02:40Z","snapshot_observed_at":"2026-08-14T09:53:07.628810Z","submitted_at":"2024-07-30T01:13:42Z","title":"A2SF: Accumulative Attention Scoring with Forgetting Factor for Token Pruning in Transformer Decoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20485","snapshot_observed_at":"2026-08-12T12:13:55.224786Z","title":"and Shin, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.224786Z"},"links":{"cited_paper":"/paper/2407.20485","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:3c9af48a03c4a7afe7926a549da105cf4a366b9d59a8a62c552e2fa98778946b","observation_id":"8efdc58e-b9ab-406d-97bb-8ff2e6959d99","resolution":{"observed_at":"2026-08-12T12:13:55.224786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16597","last_updated":"2023-05-26T03:01:07Z","snapshot_observed_at":"2026-08-13T11:32:51.275350Z","submitted_at":"2023-05-26T03:01:07Z","title":"Neural Architecture Search for Parameter-Efficient Fine-tuning of Large Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16597","snapshot_observed_at":"2026-08-12T12:13:55.228601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.228601Z"},"links":{"cited_paper":"/paper/2305.16597","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:cea7b0a63df66d0256d426364a101e94d8f5e9c387ea962236ca565d1b678b52","observation_id":"db01a03d-8a12-44a8-8aa5-8b3b5e49098f","resolution":{"observed_at":"2026-08-12T12:13:55.228601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-12T12:13:55.232251Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.232251Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:a9507a77b65775f7fc6c3285ef90545c746c92cb7acb352576ab82b31250f41b","observation_id":"0d311e58-d3d8-4e1b-9ddb-e638311862f2","resolution":{"observed_at":"2026-08-12T12:13:55.232251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:55.236317Z","title":"Svdqunat: Absorb- ing outliers by low-rank components for 4-bit diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.236317Z"},"links":{"citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:db74b45fe6aa343c9f6a5edc5a923675f9e4e2974f70450070642d233ebe19b7","observation_id":"6a7a83bb-7620-44f0-b923-b969ae532d49","resolution":{"observed_at":"2026-08-12T12:13:55.236317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-12T12:13:55.239624Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.239624Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:416679145979eeea686329290d254e15f0596e859da86920ea36a395118a39c0","observation_id":"a0b615eb-650f-46e8-8ac2-7b40970045e4","resolution":{"observed_at":"2026-08-12T12:13:55.239624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T12:13:55.243241Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.243241Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:dfe6cecfa9822bc00b9b80a53f75ed33fd5c37d8f32c90caab274d842637e548","observation_id":"ed97d7b7-c440-456b-8930-945c2dd856c0","resolution":{"observed_at":"2026-08-12T12:13:55.243241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02948","last_updated":"2025-04-09T06:54:20Z","snapshot_observed_at":"2026-08-13T00:38:23.444818Z","submitted_at":"2024-04-03T15:06:43Z","title":"PiSSA: Principal Singular Values and Singular Vectors Adaptation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02948","snapshot_observed_at":"2026-08-12T12:13:55.247477Z","title":"Pissa: Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.247477Z"},"links":{"cited_paper":"/paper/2404.02948","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:ddc3a051f5289961e5420dd0b8db2c355ea0ed7ad08f72242cab62c8087390be","observation_id":"bf7255d4-7e19-46c4-92bc-15777634fcfc","resolution":{"observed_at":"2026-08-12T12:13:55.247477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-14T04:57:43.972237Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-12T12:13:55.255781Z","title":"com/index/hello-gpt-4o/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.255781Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:4fa45823b7c29c60d5c7c988b5f19cc4f7be20dfbd0897f1568cfe5393a198df","observation_id":"14625551-786f-42c8-94b0-872174bdea33","resolution":{"observed_at":"2026-08-12T12:13:55.255781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T12:13:55.259515Z","title":"Sdxl: Im- proving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.259515Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:309aaeaa045bbf3a00994d9251faf80dc336fd23ba753883b4e69da4742b5566","observation_id":"637fb8be-84dc-49d1-886d-96ed56542cc6","resolution":{"observed_at":"2026-08-12T12:13:55.259515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-12T12:13:55.263459Z","title":"A., and Lewis, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.263459Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:64aa01f956b78a942c128c80ac9ad8811b8266a9ac231ea1a647fdc7c71417a7","observation_id":"15fe09b5-eda5-4c8f-bdf3-32cc9175b681","resolution":{"observed_at":"2026-08-12T12:13:55.263459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-12T12:13:55.267389Z","title":"Socialiqa: Commonsense reasoning about social interac- tions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.267389Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:660ffc4c28fc2ab16210e187be4669d24b8f2073eda3dc2356afbf88ed5814c3","observation_id":"04699dde-0e92-4539-bb01-aebb8cfbbd7c","resolution":{"observed_at":"2026-08-12T12:13:55.267389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-12T12:13:55.271636Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.271636Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:7d59b5977a7500908bf7f29b5735ea6d3a350df825b71fce85b134313150db23","observation_id":"d05018be-7809-413f-8ad5-dbff2ab5383b","resolution":{"observed_at":"2026-08-12T12:13:55.271636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:55.276538Z","title":"Lora vs full fine-tuning: An illusion of equivalence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.276538Z"},"links":{"citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:04c40c7c79a86a94f4ca7035e70437dfb7052b14d151db358c0d9cbfe8c8aaa1","observation_id":"240575b6-03cd-4d5e-871b-dc610e9b5332","resolution":{"observed_at":"2026-08-12T12:13:55.276538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-12T12:13:55.280224Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.280224Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:f3384f1d1bbb162a60cf30126cf27f0df0631a6529543082909e09561664437b","observation_id":"9c71ffa1-36b8-427c-a235-614f1973af5c","resolution":{"observed_at":"2026-08-12T12:13:55.280224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-14T00:44:29.108997Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-12T12:13:55.284100Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.284100Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:e38ef63dcd7dd4cc6b0fe1de3f961b1d9e6ec24aad6f05186c11d96af6ec2f2e","observation_id":"f6ace2cf-c3aa-4b23-8867-ff849a4d6a98","resolution":{"observed_at":"2026-08-12T12:13:55.284100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T12:13:55.288218Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.288218Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:f9e0b39906a5a38eadadce5d822d483033bac635483e81e2af81c28d4900af83","observation_id":"660ef298-72e2-458d-93fb-9f1d8e881473","resolution":{"observed_at":"2026-08-12T12:13:55.288218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07904","last_updated":"2022-03-16T18:52:36Z","snapshot_observed_at":"2026-08-13T17:52:41.506368Z","submitted_at":"2021-10-15T07:35:58Z","title":"SPoT: Better Frozen Model Adaptation through Soft Prompt Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07904","snapshot_observed_at":"2026-08-12T12:13:55.292531Z","title":"Spot: Better frozen model adaptation through soft prompt transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.292531Z"},"links":{"cited_paper":"/paper/2110.07904","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:9513b30298f547217a7ff77207405832dd258ebceabafeac5ee1454205d1b0c8","observation_id":"619506be-f886-471c-9b68-e780341c5a34","resolution":{"observed_at":"2026-08-12T12:13:55.292531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-12T12:13:55.296238Z","title":"Z., Khabsa, M., Fang, H., and Ma, H","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.296238Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:cc3891a797d88d2b19cd4fd64ae36902516205cf36105ee1b95c3dcfd138b236","observation_id":"0d3f4acb-fb10-4e22-b983-6bdf1b072934","resolution":{"observed_at":"2026-08-12T12:13:55.296238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05000","last_updated":"2024-07-16T07:32:23Z","snapshot_observed_at":"2026-08-14T14:29:45.574023Z","submitted_at":"2024-07-06T08:37:21Z","title":"LoRA-GA: Low-Rank Adaptation with Gradient Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05000","snapshot_observed_at":"2026-08-12T12:13:55.300598Z","title":"Lora-ga: Low-rank adap- tation with gradient approximation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.300598Z"},"links":{"cited_paper":"/paper/2407.05000","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:6907bd43b5d1a3f075dceef5b059c11de497962a1816d690cb567d23571baa5f","observation_id":"5a33cba9-a291-44de-8180-4e27d41b7b60","resolution":{"observed_at":"2026-08-12T12:13:55.300598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18242","last_updated":"2025-03-22T09:29:15Z","snapshot_observed_at":"2026-08-15T19:01:13.545599Z","submitted_at":"2024-07-25T17:57:12Z","title":"LoRA-Pro: Are Low-Rank Adapters Properly Optimized?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18242","snapshot_observed_at":"2026-08-12T12:13:55.304466Z","title":"Lora- pro: Are low-rank adapters properly optimized? arXiv preprint arXiv:2407.18242, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.304466Z"},"links":{"cited_paper":"/paper/2407.18242","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:9c095aa2594d1baa6cbb5cf962fba65b9a4252196ccde6445306df69eb9465ed","observation_id":"be1725d7-4b52-4742-bf2c-e9f870eaeae6","resolution":{"observed_at":"2026-08-12T12:13:55.304466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05687","last_updated":"2021-09-13T03:39:52Z","snapshot_observed_at":"2026-08-15T03:00:37.476718Z","submitted_at":"2021-09-13T03:39:52Z","title":"Raise a Child in Large Language Model: Towards Effective and Generalizable Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05687","snapshot_observed_at":"2026-08-12T12:13:55.308012Z","title":"Raise a child in large language model: Towards effective and generalizable fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.308012Z"},"links":{"cited_paper":"/paper/2109.05687","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:b6b13d679eda2f55f26be53acc7e5654f6264994bc4643c216f6f591e9c32a5a","observation_id":"b6fbb1ab-9ef3-4c0d-ac01-74c4d80b5d1a","resolution":{"observed_at":"2026-08-12T12:13:55.308012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-14T22:21:13.910104Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-12T12:13:55.312088Z","title":"Effectively com- press kv heads for llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.312088Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:4f22626d9a39e61837358c3df60182e12325f8b2c07271d8e0549c0cc0e5bc7b","observation_id":"ea599320-144a-4c07-a7f6-5694d63993d4","resolution":{"observed_at":"2026-08-12T12:13:55.312088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17484","last_updated":"2024-11-15T08:02:03Z","snapshot_observed_at":"2026-08-12T23:58:38.330673Z","submitted_at":"2024-05-24T16:18:16Z","title":"Bridging The Gap between Low-rank and Orthogonal Adaptation via Householder Reflection Adaptation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17484","snapshot_observed_at":"2026-08-12T12:13:55.315899Z","title":"Bridging the gap between low- rank and orthogonal adaptation via householder reflection adaptation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.315899Z"},"links":{"cited_paper":"/paper/2405.17484","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:d73ebc7279485b4f84f38a59f7f6be1ceed9bad3ac43569b02b86552797377d2","observation_id":"3f9ac2cb-643d-4fe0-aa63-60f7bce531ba","resolution":{"observed_at":"2026-08-12T12:13:55.315899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:55.319638Z","title":"B., Ravfogel, S., and Goldberg, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.319638Z"},"links":{"citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:e1e5cd1f4233159e4c6f6ff7d6a841cca9fab2430430b2192afb3f4125958ff8","observation_id":"475ee90c-7f87-405d-a658-a7024e1635e5","resolution":{"observed_at":"2026-08-12T12:13:55.319638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-12T12:13:55.323246Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.323246Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:7781c0159742398f9392d1bbb19a71efaa48133dffa4cc3b54a9a0d7cd3775c1","observation_id":"07cb534f-6e64-4e05-b2b6-ea55860b5e28","resolution":{"observed_at":"2026-08-12T12:13:55.323246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-08-12T23:46:47.414754Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-12T12:13:55.326969Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine- tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.326969Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:d7beb4d4b733d202307a77c0118d2b30932181daacebef059fb8d797c2c5db46","observation_id":"a7dbbdbe-94bc-49a0-8667-e3a1256942ec","resolution":{"observed_at":"2026-08-12T12:13:55.326969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-15T01:25:39.422061Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-12T12:13:55.330699Z","title":"Galore: Memory-efficient llm train- ing by gradient low-rank projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.330699Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:bf7a93b0148b5d487fda6de983945635ffc0cd5ed1b4c82a11907729116a22c6","observation_id":"843e2252-8382-4f64-b0e1-c34fe84d6465","resolution":{"observed_at":"2026-08-12T12:13:55.330699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12406","last_updated":"2020-10-11T11:52:08Z","snapshot_observed_at":"2026-08-08T22:25:43.361051Z","submitted_at":"2020-04-26T15:03:47Z","title":"Masking as an Efficient Alternative to Finetuning for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.12406","snapshot_observed_at":"2026-08-12T12:13:55.334461Z","title":"Mask- ing as an efficient alternative to finetuning for pretrained language models","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.334461Z"},"links":{"cited_paper":"/paper/2004.12406","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:ba3de9e68a46bbeb9bccd1132e83c691e4fd94d5ab116419bb03ba57587661b0","observation_id":"da9fe209-f295-4c5d-8ad7-1d23fb2d2c2a","resolution":{"observed_at":"2026-08-12T12:13:55.334461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02411","last_updated":"2023-09-05T17:40:34Z","snapshot_observed_at":"2026-08-13T10:19:53.668853Z","submitted_at":"2023-09-05T17:40:34Z","title":"Delta-LoRA: Fine-Tuning High-Rank Parameters with the Delta of Low-Rank Matrices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02411","snapshot_observed_at":"2026-08-12T12:13:55.338087Z","title":"Delta-lora: Fine-tuning high-rank parame- ters with the delta of low-rank matrices","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.338087Z"},"links":{"cited_paper":"/paper/2309.02411","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:e8bfef8e4682f1431e314768b0f37d2989c0234cd6acc73ea1806d8b0dd7df8a","observation_id":"d09c4ece-256c-4ea1-96f7-028e913730ed","resolution":{"observed_at":"2026-08-12T12:13:55.338087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09297","last_updated":"2024-10-15T08:45:18Z","snapshot_observed_at":"2026-08-14T18:24:43.362246Z","submitted_at":"2024-06-13T16:33:44Z","title":"MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09297","snapshot_observed_at":"2026-08-12T12:13:55.342435Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.342435Z"},"links":{"cited_paper":"/paper/2406.09297","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:1db07a8ded9dbf044377da6736650eff497e91195fb665995801749d30fe8d15","observation_id":"b3ed83cb-0398-441a-9e59-5dc460e7eb44","resolution":{"observed_at":"2026-08-12T12:13:55.342435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:56.118516Z","title":"Both PiSSA and CLOVER exhibit stable training performance","venue":null,"work_id":"620a7c4f-f636-48db-b980-8ec77c4fe4dc","year":2023},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.346396Z"},"links":{"citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:4300605dc5eba6cc1dd0439e6b12d59d66aa5056eaceb2004c216cc3c28c4115","observation_id":"5aeffe0e-bb90-436e-b275-c93b47495d8c","resolution":{"observed_at":"2026-08-12T12:13:56.122693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:13:56.106054Z","title":"WinoGrande (Sakaguchi et al., 2021)40,398 1,267 Fill-in-the-blank task with binary options","venue":null,"work_id":"13b57f2d-dedb-4ad1-baca-797c13996182","year":2021},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.350447Z"},"links":{"citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:19ed9beb395c072e8eed873a96f364925f90e1f137a7e1325e315525aace7826","observation_id":"e2247d2f-1422-47e2-9d58-7cb74167d6c7","resolution":{"observed_at":"2026-08-12T12:13:56.111179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-12T12:13:55.251169Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.251169Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:9fb368d6254cd6218903bf3e6f97b159486cbc24889ae2e258966e7028b5af31","observation_id":"22ab034e-e45a-4f54-a332-90fad52f2572","resolution":{"observed_at":"2026-08-12T12:13:55.251169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T12:13:55.170833Z","title":"L., Fernando, A., Botev, A., Cristian- Muraru, G., Gu, A., Haroun, R., Berrada, L., Chen, Y ., Srinivasan, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.170833Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:43554e097eca386a26acf9ac696472a9902930d2d01daeb1ca0225e5e48fd5e2","observation_id":"57bfdbea-7147-42fb-af31-eec34fd06814","resolution":{"observed_at":"2026-08-12T12:13:55.170833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-12T12:13:55.166830Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.166830Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:320f818ad83193e932ade490bfe099932aef42323e1873e615f856e9e695b3ce","observation_id":"5fa3912f-45f4-4269-b69f-cf1d63b4892d","resolution":{"observed_at":"2026-08-12T12:13:55.166830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-14T05:37:38.971220Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-12T12:13:55.149273Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.149273Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:ef0d418744ca2a00d3f2054ef032c23f8773449b7b31acb4921ef8090de05c82","observation_id":"24e3e211-2a95-4ad7-ae8a-add9f701ff2f","resolution":{"observed_at":"2026-08-12T12:13:55.149273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-13T04:29:50.330115Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T12:13:55.213100Z","title":"W., Shao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.213100Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:c6662cbc0b83aeaf0db6d204fa69035341ed0ee71c80fa3884802424cda7c67b","observation_id":"6070763a-9f62-4b58-96cd-0a12f6c51a35","resolution":{"observed_at":"2026-08-12T12:13:55.213100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-14T10:49:22.047809Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-12T12:13:55.145477Z","title":"L., Nascimento, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.145477Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:d6121fd3b26619db444cfe72fce7d758739b57997701c84bf6d67407998c53ad","observation_id":"11bb79f1-156b-44b5-9a75-637491669c6b","resolution":{"observed_at":"2026-08-12T12:13:55.145477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-13T05:35:04.248097Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-12T12:13:55.192490Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.192490Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:74a39de41bb2e82bcecfaf45894ce125ccba85cfd79eaf93105767f434fbefd2","observation_id":"437710f4-7ee4-4ccd-95db-a43f4d3c31ea","resolution":{"observed_at":"2026-08-12T12:13:55.192490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T12:13:55.123699Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.123699Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:4a1fdedaf088810acac36a3f85ea97e2c87851d35132ee9491bdb389d9762e6a","observation_id":"00c88cea-f1f3-4847-a5af-51cb609aec90","resolution":{"observed_at":"2026-08-12T12:13:55.123699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07560","last_updated":"2023-02-09T10:54:10Z","snapshot_observed_at":"2026-08-15T03:00:33.944151Z","submitted_at":"2021-10-14T17:27:29Z","title":"Composable Sparse Fine-Tuning for Cross-Lingual Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07560","snapshot_observed_at":"2026-08-12T12:13:55.135912Z","title":"net/forum?id=TwJrTz9cRS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-12T12:13:55.135912Z"},"links":{"cited_paper":"/paper/2110.07560","citing_paper":"/paper/2411.17426"},"observation_digest":"sha256:b16d77b159b49974a1ca1b2d9bcdbf57134560c43f9e2a540b09a32ab3ee2eb4","observation_id":"a30bc37d-1daa-4197-b60d-85e3ff4c62f6","resolution":{"observed_at":"2026-08-12T12:13:55.135912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17426","last_updated":"2025-01-31T14:13:49Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T13:04:05.017929Z","submitted_at":"2024-11-26T13:34:02Z","title":"CLOVER: Cross-Layer Orthogonal Vectors Pruning and Fine-Tuning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2411.17426."}