{"as_of":"2026-08-10T10:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3db68e7fbdbf1122d21176e8f180d2aa7f9c2f931ef95db03353ad51f06718a7","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:33:17.278546Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16191/citation-record","integrity":"/paper/2508.16191/integrity","json":"/paper/2508.16191/citation-record.json","paper":"/paper/2508.16191"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.14470","last_updated":"2025-06-23T16:25:27Z","snapshot_observed_at":"2026-08-08T07:47:48.276022Z","submitted_at":"2024-08-26T17:58:53Z","title":"Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":"2408.14470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14470","snapshot_observed_at":"2026-08-05T17:33:18.576356Z","title":"Step-by-Step Unmasking for Parameter-Efficient Fine-tuning of Large Language Models","venue":"cs.CL","work_id":"e890c929-459b-4258-af96-9e7a67fb1239","year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:12.771427Z"},"links":{"cited_paper":"/paper/2408.14470","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:76f7fa26d998263f774048a43c2d8f08a73a4f5a14f99a111e8de626bda62775","observation_id":"3f608c5b-67aa-4a15-8bda-57f44af4bdf0","resolution":{"observed_at":"2026-08-05T17:33:18.651844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-05T17:33:12.839802Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:12.839802Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:1010680c67985a067c35f4c338198ca4011dc91d89f8a71eaaed7894fd6a1c53","observation_id":"ced5fa40-a84e-4dac-a45d-b66940ff799c","resolution":{"observed_at":"2026-08-05T17:33:12.839802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T17:33:12.919440Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:12.919440Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:02071e002084649b6a5f247f0d902f95f1c658801bf6c04231f4e122ab6d5416","observation_id":"241aac14-8c28-42f1-a502-42a0da460e2f","resolution":{"observed_at":"2026-08-05T17:33:12.919440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:19.828001Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":"134a43c3-7a41-40f0-8fbb-071817b831c5","year":2019},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.026944Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:fddb450583ba816d5fd6758c0a42283370bce8a4f4b974c363a6b8df02f012ca","observation_id":"0dd9c966-b57e-4491-a159-9a0eef6c84f5","resolution":{"observed_at":"2026-08-05T17:33:19.901950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T17:33:13.187428Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.187428Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:e39c07f3401d6d999f7d678e4c843c0580336ee9702372b531160770e5453f5a","observation_id":"6fb2da2f-5be9-48d8-9a22-bee4c867411b","resolution":{"observed_at":"2026-08-05T17:33:13.187428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:19.673766Z","title":"The pascal recognising textual entailment challenge","venue":null,"work_id":"dc5f1b2f-2e91-414a-921b-4ff8cad37052","year":2005},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.332462Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:9cda9a891af7da721cfd1f68a9ae51f9b9de312ead8276e9593d712f2f985899","observation_id":"31533800-2b6d-4326-82dc-8963d50809ac","resolution":{"observed_at":"2026-08-05T17:33:19.741861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03748","last_updated":"2023-11-07T06:19:37Z","snapshot_observed_at":"2026-08-08T22:59:37.561433Z","submitted_at":"2023-11-07T06:19:37Z","title":"Unified Low-Resource Sequence Labeling by Sample-Aware Dynamic Sparse Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03748","snapshot_observed_at":"2026-08-05T17:33:13.475037Z","title":"Unified low-resource sequence labeling by sample-aware dynamic sparse finetuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.475037Z"},"links":{"cited_paper":"/paper/2311.03748","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:d56f2b3044b9031a52ff6060fa663a60c94ad8c220b0bd2718628ae29fb73f3a","observation_id":"d66a7e00-af97-493b-aaa5-77317cd53982","resolution":{"observed_at":"2026-08-05T17:33:13.475037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-05T17:33:13.567444Z","title":"Qlora: Efficient finetuning of quantized llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.567444Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:276f6f506e2a3ccc2bd681730fdfad9f68cb62ff123e29121fa3a92517bdc844","observation_id":"bef0ac6b-7616-406b-9f20-d081a0622cfe","resolution":{"observed_at":"2026-08-05T17:33:13.567444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11696","last_updated":"2023-11-20T11:56:25Z","snapshot_observed_at":"2026-08-04T08:07:45.481643Z","submitted_at":"2023-11-20T11:56:25Z","title":"Sparse Low-rank Adaptation of Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11696","snapshot_observed_at":"2026-08-05T17:33:13.657154Z","title":"Sparse low-rank adaptation of pre-trained language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.657154Z"},"links":{"cited_paper":"/paper/2311.11696","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:86c2fdd4e9e8e781f378dd4c7ab307125ec9d8e8e981f350c29bdd06ab8403e2","observation_id":"dd989852-0977-45ed-b658-fe7f01c8d078","resolution":{"observed_at":"2026-08-05T17:33:13.657154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:19.524214Z","title":"Xo RA : Expander adapted lo RA finetuning","venue":null,"work_id":"4f913a3a-b9f5-402b-bdec-37306443bd2c","year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.736998Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:5fbe30dc498cd10f6f8607deb33dd345e9b2a72baa47bd7ea8f674250f82b600","observation_id":"41924d27-c112-44be-a263-08c62fac779e","resolution":{"observed_at":"2026-08-05T17:33:19.581371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-05T23:54:27.386622Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-05T17:33:13.812258Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.812258Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:36c31fb24f4d49d041908411e3fcacd107a0705cfbca24c98a320722b332d57a","observation_id":"4c022bbc-f032-41fa-91e3-065d2a571fb5","resolution":{"observed_at":"2026-08-05T17:33:13.812258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T17:33:13.957240Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:13.957240Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:f269258ca33896eaeb31d3ac34f658992f5296ca08e5b53960c8bf8c096526e6","observation_id":"d141022c-5142-4941-8199-f66c33bf4c97","resolution":{"observed_at":"2026-08-05T17:33:13.957240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03792","last_updated":"2024-06-06T07:03:29Z","snapshot_observed_at":"2026-08-05T15:34:38.847534Z","submitted_at":"2024-06-06T07:03:29Z","title":"Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning","version":1},"cited_work":{"arxiv_id":"2406.03792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03792","snapshot_observed_at":"2026-08-05T17:33:18.312796Z","title":"Light-PEFT: Lightening Parameter-Efficient Fine-Tuning via Early Pruning","venue":"cs.CL","work_id":"3632371a-ebeb-4f4a-a2d0-09f8ee70ed7a","year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.113201Z"},"links":{"cited_paper":"/paper/2406.03792","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:4ed526dc6c333701510d8998b8e5a5fc304d1e499ca30ee2c3eaae86e427fb70","observation_id":"9b212754-99a6-4e22-9e82-06e0e8796ff4","resolution":{"observed_at":"2026-08-05T17:33:18.411079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-05T17:33:14.227984Z","title":"Textbooks are all you need, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.227984Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:03f89df86e3c4a0f20f970fc0935130c7917784d58d986515c336f7a1955e23d","observation_id":"cf19e553-4b57-4e17-a109-30cdf526e666","resolution":{"observed_at":"2026-08-05T17:33:14.227984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07463","last_updated":"2021-06-09T14:39:17Z","snapshot_observed_at":"2026-08-10T10:06:48.397353Z","submitted_at":"2020-12-14T12:34:01Z","title":"Parameter-Efficient Transfer Learning with Diff Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07463","snapshot_observed_at":"2026-08-05T17:33:14.305960Z","title":"Rush, and Yoon Kim","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.305960Z"},"links":{"cited_paper":"/paper/2012.07463","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:00af71e0d6019d40b97bb650c9c2ee667cfa734d7b4bd47f9c7765ae0d375510","observation_id":"2020c9fd-ada6-409f-8cb8-28bc2d8010cc","resolution":{"observed_at":"2026-08-05T17:33:14.305960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:14.418031Z","title":"Gora: Gradient-driven adaptive low rank adaptation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.418031Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:7f627638e7364facc2f2acdc882fc026fa2a9cba5897be83d68799da6c56aaa3","observation_id":"f84976e3-5880-4030-b5df-5eae5bd0db83","resolution":{"observed_at":"2026-08-05T17:33:14.418031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-05T17:33:14.531714Z","title":"Parameter-efficient transfer learning for nlp, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.531714Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:234e6c149239d13cbbdc1f4c44324557cf4560656a41823f56846fc29d8bc7e5","observation_id":"1f39d57b-a4ec-4a68-9ccd-e4167c157e22","resolution":{"observed_at":"2026-08-05T17:33:14.531714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T17:33:14.677479Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.677479Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:a2dd00f1ae09cb00094db7941b52a09d11b87a7d42a0112f9b2d27c566bccd30","observation_id":"2782ce0b-c017-4c80-b781-fae6510f1aae","resolution":{"observed_at":"2026-08-05T17:33:14.677479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:19.333891Z","title":"Looking beyond the surface: A challenge set for reading comprehension over multiple sentences","venue":null,"work_id":"cce965ca-0665-4142-974a-80fd08966290","year":2018},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.771565Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:16bbf772b546cf07da8a7867e7a21440f1ca98beacb20b4b3e208f2f270e3e1a","observation_id":"c7619741-a3ca-4874-b73b-471540d4e686","resolution":{"observed_at":"2026-08-05T17:33:19.440864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11454","last_updated":"2024-01-16T18:59:22Z","snapshot_observed_at":"2026-08-09T04:48:28.604919Z","submitted_at":"2023-10-17T17:59:46Z","title":"VeRA: Vector-based Random Matrix Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11454","snapshot_observed_at":"2026-08-05T17:33:14.836891Z","title":"Kopiczko, Tijmen Blankevoort, and Yuki M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.836891Z"},"links":{"cited_paper":"/paper/2310.11454","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:dc0e2b6ab60d5df9bc2415229fbc6bdf3f332cecd1b3772e9768e73cfb579cea","observation_id":"a3e8dee5-fe8a-438e-9055-3f3d7d882b2e","resolution":{"observed_at":"2026-08-05T17:33:14.836891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15330","last_updated":"2025-02-13T13:06:00Z","snapshot_observed_at":"2026-08-06T02:17:17.117766Z","submitted_at":"2024-06-21T17:42:52Z","title":"Enhancing Large Language Model Performance with Gradient-Based Parameter Selection","version":2},"cited_work":{"arxiv_id":"2406.15330","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15330","snapshot_observed_at":"2026-08-05T17:33:18.022133Z","title":"Enhancing Large Language Model Performance with Gradient-Based Parameter Selection","venue":"cs.AI","work_id":"d855772c-aeb5-4e55-87c8-d765383e0c47","year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:14.924155Z"},"links":{"cited_paper":"/paper/2406.15330","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:dc5dc8eb422e616e27fd9e50ecc2fb5a8c5bc8c65e59ea2008fd344d04aa16db","observation_id":"0bd1e196-8672-4d1c-8baf-edddea6c96e5","resolution":{"observed_at":"2026-08-05T17:33:18.081272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-05T17:33:15.028510Z","title":"Prefix-tuning: Optimizing continuous prompts for generation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.028510Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:2e888d6e96f9130515209145c8891bc8a73ec91204a9acbeca019a44fff10052","observation_id":"c5fb43a1-b53e-439a-9164-8b75a9a19101","resolution":{"observed_at":"2026-08-05T17:33:15.028510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-05T17:33:15.123076Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.123076Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:f3b774286f118e6e6346f5c2ac4e9db44ee7f9c72f364b762d4d32af22e288ab","observation_id":"0732a16b-1893-48b9-b5d2-801deaf9f16a","resolution":{"observed_at":"2026-08-05T17:33:15.123076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16187","last_updated":"2024-04-15T13:25:05Z","snapshot_observed_at":"2026-08-10T03:59:47.041863Z","submitted_at":"2024-03-24T15:09:55Z","title":"ALoRA: Allocating Low-Rank Adaptation for Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16187","snapshot_observed_at":"2026-08-05T17:33:15.257502Z","title":"Alora: Allocating low-rank adaptation for fine-tuning large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.257502Z"},"links":{"cited_paper":"/paper/2403.16187","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:3a795f9bf1ff5f3c4a08eda2ddf8745a811d1bf4aaf3eb790693b50a2a9c2dbe","observation_id":"a26cd787-9830-44fe-b122-55eefd1ccc8d","resolution":{"observed_at":"2026-08-05T17:33:15.257502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04647","last_updated":"2021-11-27T13:48:40Z","snapshot_observed_at":"2026-08-08T09:07:49.828598Z","submitted_at":"2021-06-08T19:17:04Z","title":"Compacter: Efficient Low-Rank Hypercomplex Adapter Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04647","snapshot_observed_at":"2026-08-05T17:33:15.367652Z","title":"Compacter: Efficient low-rank hypercomplex adapter layers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.367652Z"},"links":{"cited_paper":"/paper/2106.04647","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:6667d13b0256075db5d224e4e341029f30b862e1e034d7751b38b18ce731b90d","observation_id":"7559f462-a32c-4ec9-94ac-aab7bc99d807","resolution":{"observed_at":"2026-08-05T17:33:15.367652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:19.163947Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"880bfbf7-eba8-47b5-bad5-7917d20497b0","year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.461503Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:bd4fb695e36d102a16937b6b11d8235837e95513b30da02bf1680eb3f64e7512","observation_id":"7152f900-e565-4513-a333-ba2956dd8b4d","resolution":{"observed_at":"2026-08-05T17:33:19.238284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.07779","last_updated":"2020-10-06T10:16:39Z","snapshot_observed_at":"2026-07-06T09:38:29.271727Z","submitted_at":"2020-07-15T15:56:05Z","title":"AdapterHub: A Framework for Adapting Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.07779","snapshot_observed_at":"2026-08-05T17:33:15.503670Z","title":"Adapterhub: A framework for adapting transformers, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.503670Z"},"links":{"cited_paper":"/paper/2007.07779","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:df612ca0fc1e585fbc477050d84fc6f420d1cd6367ae43f43961b8f21b3a5f41","observation_id":"aef78e1b-9790-41ad-aaa5-df99563c07a0","resolution":{"observed_at":"2026-08-05T17:33:15.503670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00247","last_updated":"2021-01-26T12:54:33Z","snapshot_observed_at":"2026-08-09T18:48:57.194984Z","submitted_at":"2020-05-01T07:03:42Z","title":"AdapterFusion: Non-Destructive Task Composition for Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00247","snapshot_observed_at":"2026-08-05T17:33:15.587239Z","title":"Adapterfusion: Non-destructive task composition for transfer learning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.587239Z"},"links":{"cited_paper":"/paper/2005.00247","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:9558693805c9ed893746d44014d5e8c73c1323350f97e9d46e0a854f4eae5271","observation_id":"5dae3360-0e9e-437a-ba48-5806fcc023ec","resolution":{"observed_at":"2026-08-05T17:33:15.587239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09121","last_updated":"2019-04-27T09:31:59Z","snapshot_observed_at":"2026-07-06T06:57:46.546190Z","submitted_at":"2018-08-28T05:16:35Z","title":"WiC: the Word-in-Context Dataset for Evaluating Context-Sensitive Meaning Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.09121","snapshot_observed_at":"2026-08-05T17:33:15.702574Z","title":"Wic: 10,000 example pairs for evaluating context-sensitive representations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.702574Z"},"links":{"cited_paper":"/paper/1808.09121","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:4aafb4935fbb2d12c10f3139af660b04dcc2be125e03c8d58298affeab1c27d3","observation_id":"3936f051-f4df-45b4-9a43-772ae8e95a15","resolution":{"observed_at":"2026-08-05T17:33:15.702574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:15.833300Z","title":"Know what you don ' t know: Unanswerable questions for SQ u AD","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.833300Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:666e09a301e186b36d81e971480362609493a1ef47d1a34d8916cda5ef2c35a2","observation_id":"fca64d7e-309f-465c-9613-20d36c42d629","resolution":{"observed_at":"2026-08-05T17:33:15.833300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:19.041641Z","title":"Choice of plausible alternatives: An evaluation of commonsense causal reasoning","venue":null,"work_id":"c1284710-28b0-4b3b-a0de-7a9af8216842","year":2011},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.904883Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:1cae06e0dd5d39f46c5ff4f899b1686e294f570090320dc4eee34714dabc19f5","observation_id":"eddb13b5-baca-4bb0-8d00-31d9ced6898e","resolution":{"observed_at":"2026-08-05T17:33:19.106306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:18.887292Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":"c02ca109-10e1-478f-b5b1-63f39a541c26","year":2013},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:15.990313Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:8225e19697e17cae9ca1f720dbd0356adef02862523c365edfe3c4bb0a154b21","observation_id":"cc04bbf7-e983-4857-bf1c-0fcb435fabe5","resolution":{"observed_at":"2026-08-05T17:33:18.972778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11875","last_updated":"2024-06-08T03:29:17Z","snapshot_observed_at":"2026-07-06T17:05:06.923713Z","submitted_at":"2023-12-19T06:06:30Z","title":"Sparse is Enough in Fine-tuning Pre-trained Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11875","snapshot_observed_at":"2026-08-05T17:33:16.066343Z","title":"Sparse is enough in fine-tuning pre-trained large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.066343Z"},"links":{"cited_paper":"/paper/2312.11875","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:e342906c7c59f2311de7c6932afcda0d13f420cd36d93b4c72193d0711ee8f31","observation_id":"9b6f2c04-0c80-4605-be26-8b12d05f768a","resolution":{"observed_at":"2026-08-05T17:33:16.066343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09839","last_updated":"2021-11-18T18:06:01Z","snapshot_observed_at":"2026-08-07T01:37:17.867619Z","submitted_at":"2021-11-18T18:06:01Z","title":"Training Neural Networks with Fixed Sparse Masks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09839","snapshot_observed_at":"2026-08-05T17:33:16.131863Z","title":"Training neural networks with fixed sparse masks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.131863Z"},"links":{"cited_paper":"/paper/2111.09839","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:961c1028c0d3608c67265acce753737d0998b38298949902bbf31910ed885f65","observation_id":"685150dd-9b59-4131-8ee2-ed93020e951f","resolution":{"observed_at":"2026-08-05T17:33:16.131863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T17:33:16.223836Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.223836Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:4795c0a10ea462bfbb0e5786ff594cc955bf479ac42a48704c05b174098e7b05","observation_id":"1e07e83f-675d-4898-b249-103416c0ed7e","resolution":{"observed_at":"2026-08-05T17:33:16.223836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:18.760302Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":"29f8bb19-91b6-4231-b8c8-5cc22b891169","year":2018},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.373356Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:285c6efe086a1cfb11c35f6bb169df3ee026603f78786e8179a3d57dc0b11a44","observation_id":"1aa5aebf-6db9-42aa-a25b-a2674c9a7f1a","resolution":{"observed_at":"2026-08-05T17:33:18.818692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-05T17:33:16.462429Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.462429Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:8b3e9ce316ddaf1c090081f477fcefa640ac639db57c1546021240c4f716e19d","observation_id":"77590faa-bb67-4bab-84b7-a5374d3df39a","resolution":{"observed_at":"2026-08-05T17:33:16.462429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02596","last_updated":"2024-05-04T07:44:18Z","snapshot_observed_at":"2026-08-06T04:49:40.074002Z","submitted_at":"2024-05-04T07:44:18Z","title":"Random Masking Finds Winning Tickets for Parameter Efficient Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02596","snapshot_observed_at":"2026-08-05T17:33:16.547782Z","title":"Random masking finds winning tickets for parameter efficient fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.547782Z"},"links":{"cited_paper":"/paper/2405.02596","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:a636a04dd67a4c5ae9a66a12b1eec59e0e68e7bc9ea233f9c33415f1bc553ee5","observation_id":"bcb6d216-929c-4819-a916-c6c6a1d2d1ed","resolution":{"observed_at":"2026-08-05T17:33:16.547782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05687","last_updated":"2021-09-13T03:39:52Z","snapshot_observed_at":"2026-08-05T01:06:28.807438Z","submitted_at":"2021-09-13T03:39:52Z","title":"Raise a Child in Large Language Model: Towards Effective and Generalizable Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05687","snapshot_observed_at":"2026-08-05T17:33:16.622932Z","title":"Raise a child in large language model: Towards effective and generalizable fine-tuning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.622932Z"},"links":{"cited_paper":"/paper/2109.05687","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:1a0d35e7540c9f0f6bd855c0437a19452d48fe1b75626fc419bdcca1d8455063","observation_id":"98375c99-8f46-4302-bc8e-676094bc1b9f","resolution":{"observed_at":"2026-08-05T17:33:16.622932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12579","last_updated":"2025-05-18T23:45:50Z","snapshot_observed_at":"2026-08-07T15:43:35.414765Z","submitted_at":"2025-05-18T23:45:50Z","title":"Adaptive parameter-efficient fine-tuning via Hessian-informed subset selection","version":1},"cited_work":{"arxiv_id":"2505.12579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12579","snapshot_observed_at":"2026-08-05T17:33:17.721401Z","title":"Adaptive parameter-efficient fine-tuning via Hessian-informed subset selection","venue":"cs.LG","work_id":"efda116c-2a00-46a9-87cb-013f9888d0a7","year":2025},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.699502Z"},"links":{"cited_paper":"/paper/2505.12579","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:c8f6edc4fe16cd665f81af7a6416b2ccf627ad35402c4e6e58d8734460c78fe6","observation_id":"84caad95-cdb8-415f-8e38-f0b3af41e05c","resolution":{"observed_at":"2026-08-05T17:33:17.784963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:33:16.793882Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.793882Z"},"links":{"citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:550d00c435f5dc813035ed8f98960bd715593072d95c4914316b6ce650a87f72","observation_id":"f33e3494-a4ee-4963-a2ba-a15af7b04205","resolution":{"observed_at":"2026-08-05T17:33:16.793882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03303","last_updated":"2026-05-09T05:30:15Z","snapshot_observed_at":"2026-08-08T14:14:26.000056Z","submitted_at":"2023-08-07T05:12:27Z","title":"LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03303","snapshot_observed_at":"2026-08-05T17:33:16.928324Z","title":"Lora-fa: Memory-efficient low-rank adaptation for large language models fine-tuning, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:16.928324Z"},"links":{"cited_paper":"/paper/2308.03303","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:07ed6f87592ac3148c690cdc20424f0ca07a21c9e0bef48aca2315066b37f859","observation_id":"73a82e9a-bf96-4f26-b2c0-8f502bab158e","resolution":{"observed_at":"2026-08-05T17:33:16.928324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-05T17:33:17.053712Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:17.053712Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:d44d3561e8711328d192cbe50998699bc0e1a0570ef84721bbdaab7dbf1343d7","observation_id":"21b668b0-6030-4e0b-b14c-409376b230ca","resolution":{"observed_at":"2026-08-05T17:33:17.053712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-05T17:33:17.084635Z","title":"Opt: Open pre-trained transformer language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:17.084635Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:8a5bbc3ef6a1720da240602dad3233ae4b339481fed7750b413cef7f542f1b7d","observation_id":"cda02456-f76a-4a96-a948-ecfb0cf2c591","resolution":{"observed_at":"2026-08-05T17:33:17.084635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10136","last_updated":"2024-06-11T22:45:49Z","snapshot_observed_at":"2026-08-09T01:14:46.063330Z","submitted_at":"2023-12-15T18:59:05Z","title":"Gradient-based Parameter Selection for Efficient Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2312.10136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.10136","snapshot_observed_at":"2026-08-05T17:33:17.383486Z","title":"Gradient-based Parameter Selection for Efficient Fine-Tuning","venue":"cs.CV","work_id":"aa7d0768-cde6-4745-acf7-ee83f42d6e54","year":2023},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:17.178516Z"},"links":{"cited_paper":"/paper/2312.10136","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:b1d82ee6d48ce516a0e20559bee89f4ff23dd41ef7972f4e3a5d4ddcd8815dd6","observation_id":"377bd2eb-7d7c-4b5e-b12c-445cb009b6ce","resolution":{"observed_at":"2026-08-05T17:33:17.487998Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12406","last_updated":"2020-10-11T11:52:08Z","snapshot_observed_at":"2026-08-08T22:25:43.361051Z","submitted_at":"2020-04-26T15:03:47Z","title":"Masking as an Efficient Alternative to Finetuning for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.12406","snapshot_observed_at":"2026-08-05T17:33:17.278546Z","title":"Masking as an efficient alternative to finetuning for pretrained language models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:17.278546Z"},"links":{"cited_paper":"/paper/2004.12406","citing_paper":"/paper/2508.16191"},"observation_digest":"sha256:ae2b81da583990dca64d4e5a7df69bb42071da05de18ef5e66f9142e2ef46d4f","observation_id":"1d975d77-176e-4ae7-91d5-b8c5e078fcff","resolution":{"observed_at":"2026-08-05T17:33:17.278546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16191","last_updated":"2025-08-22T08:12:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:09:26.472798Z","submitted_at":"2025-08-22T08:12:06Z","title":"GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":5,"verified_fuzzy":8},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2508.16191."}