{"as_of":"2026-08-17T19:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ba28c949c51aecae1575a661e9db36b72f5a6811b5a0d21763a2144feacf426","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:01.600260Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12471/citation-record","integrity":"/paper/2504.12471/integrity","json":"/paper/2504.12471/citation-record.json","paper":"/paper/2504.12471"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T12:40:01.378085Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.378085Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:d7a5335e543b2a2822f06d3359b833958e1c7f0b72971e23b7f2d19faed97298","observation_id":"d5bc583a-1d18-4d07-b544-3cfbc9c63eca","resolution":{"observed_at":"2026-08-16T12:40:01.378085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-16T12:40:01.383768Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.383768Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:ef92bea96f86f060466fed0dd8bfaa970e3ccdbc138642f29390e2c0bae6060c","observation_id":"04709667-ddbf-405f-a4bd-73688a44223d","resolution":{"observed_at":"2026-08-16T12:40:01.383768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.389715Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.389715Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:37f252b824b13d0fe3bf316f5e5cf8f51eb82fcfd88bf6302c0e62289286aef9","observation_id":"02205f2c-1793-4a17-99bf-9f8710723541","resolution":{"observed_at":"2026-08-16T12:40:01.389715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.394718Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.394718Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:1957d8f0f40ff92e93892e95cb6ed21a9cfa1691614ffda7a112bcc0ccb42a9d","observation_id":"d6e31786-ba41-4a6b-a1f7-3ff7ca54effd","resolution":{"observed_at":"2026-08-16T12:40:01.394718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-16T12:40:01.399645Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.399645Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:973813f93b72700a9344698360f1d22642a0f263d16dcc28b7522b66c68b9e81","observation_id":"82e43c9f-4fc6-4ad5-ae42-b7508533dd6a","resolution":{"observed_at":"2026-08-16T12:40:01.399645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-16T12:40:01.404894Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.404894Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:fd4db8de964fe79b0e92d434ceeefb4476a2753b3d3cf12261240b2ae88615c0","observation_id":"3a1ef966-eeb9-4a2e-b753-49bee8ac847e","resolution":{"observed_at":"2026-08-16T12:40:01.404894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.410614Z","title":"Tokens-to-token vit: Training vision transformers from scratch on imagenet,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.410614Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:620d95186b0559fd859ca94cb3e1b605e86c7c7377b0bdf6b40774329d281943","observation_id":"e3d99227-abc4-49eb-a972-63038d69d19e","resolution":{"observed_at":"2026-08-16T12:40:01.410614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.267058Z","title":"Train big, then compress: Rethinking model size for efficient training and inference of transformers,","venue":null,"work_id":"2d4abf29-52e1-4fd1-a482-6d5f85208da5","year":2020},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.415236Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:4fe197282c4cc27b35c97ad67388681e9263e77c34d53fe70e55a63f2ced37a3","observation_id":"86087a9a-baec-4b2b-a6dc-ae24c91e7838","resolution":{"observed_at":"2026-08-16T12:40:02.272089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.419869Z","title":"Decoupled greedy learning of cnns,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.419869Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:f869111820f62f2eb2e8a7f97624f613ef2ed1cb745b56a58a34bca895968878","observation_id":"0e480de8-554a-4c8f-a501-7298829a108a","resolution":{"observed_at":"2026-08-16T12:40:01.419869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.241512Z","title":"Distributed learning of fully connected neural networks using indepen- dent subnet training,","venue":null,"work_id":"fb78d482-a7d3-4afb-b91b-3dae5dfdc62a","year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.424539Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:7830781d5a14d4051a64fafdd96b875e9392e603f8867683b16b31912f80495c","observation_id":"4e8f5d6b-9443-41c8-bf3c-74974535856d","resolution":{"observed_at":"2026-08-16T12:40:02.246274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.224753Z","title":"Decentralized training of foundation models in heterogeneous environments,","venue":null,"work_id":"b78c8c3d-f5bd-4429-8097-47e65c0d72b4","year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.429256Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:2e287a1c4cd09e743a04971d7e97c53348ef91d291857750452c321dc0c90845","observation_id":"c023a108-ae6c-4b7d-8f26-6d9c6cc591b6","resolution":{"observed_at":"2026-08-16T12:40:02.230088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T12:40:01.434243Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.434243Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:69e658008fdec13a7721aa94aa61a7f6c2a4bf04916dffa8a43143fdfb658d1b","observation_id":"f041e34f-aae2-4916-9ead-f60fc8ea61d7","resolution":{"observed_at":"2026-08-16T12:40:01.434243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-08-14T00:06:21.089704Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-16T12:40:01.439349Z","title":"Gspmd: general and scalable parallelization for ml computation graphs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.439349Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:a9d370b3a58309528031ca1452b87e021b4f25cc7647485ac3e5c0c9b0de5268","observation_id":"6faf335d-8fd7-4e43-96fd-e2b04e8c3269","resolution":{"observed_at":"2026-08-16T12:40:01.439349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.209800Z","title":"An efficient 2d method for training super-large deep learning models,","venue":null,"work_id":"c1acdef5-e4b1-4d3b-8489-92584ff00c48","year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.444343Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:23196835c1ca6168e9938a018a3c8a9db9218dad9a76c7bcd58b38893454c455","observation_id":"ccaef75d-83c5-4b45-8cec-db44cf6b1fc8","resolution":{"observed_at":"2026-08-16T12:40:02.214409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14450","last_updated":"2021-05-30T07:41:08Z","snapshot_observed_at":"2026-08-16T18:21:16.383131Z","submitted_at":"2021-05-30T07:41:08Z","title":"Maximizing Parallelism in Distributed Training for Huge Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14450","snapshot_observed_at":"2026-08-16T12:40:01.449128Z","title":"Maximizing parallelism in distributed training for huge neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.449128Z"},"links":{"cited_paper":"/paper/2105.14450","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:11cf75df1d3a5a2154cffa98093949832c6a689139a1f6dc2487909f0f0b5bdf","observation_id":"4320ec30-7210-40a5-a002-fee5d1716e03","resolution":{"observed_at":"2026-08-16T12:40:01.449128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.454113Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.454113Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:3a233e5792c1dab9a913d67549e113a8e78d23831f1a761c509b1501b2c05320","observation_id":"49b9a9a7-10df-4ba2-ae0c-5e966e4f8c9b","resolution":{"observed_at":"2026-08-16T12:40:01.454113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T12:40:01.458824Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.458824Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:f2aeb353030f60cf5d17ac1ca7c51685882649a9b238bbfc7aa0bb4d9af184bb","observation_id":"56549b7d-b47f-46af-a1bc-77c70bf23c34","resolution":{"observed_at":"2026-08-16T12:40:01.458824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T12:40:01.463962Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.463962Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:c2cd4e3c27a2e60f230219715ea06172b1dbf5912e34282164590f492aa33ff5","observation_id":"eb481c18-cf18-4341-ad44-d177df2609b1","resolution":{"observed_at":"2026-08-16T12:40:01.463962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.469195Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.469195Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:85e824875b43ac3f790377d6c0f179dcd97df7ca66b1638d6e4dd11e8f6d65f6","observation_id":"4dc69d1d-4ee9-45f5-9ddb-999c73ec0a71","resolution":{"observed_at":"2026-08-16T12:40:01.469195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.474722Z","title":"Transformer in transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.474722Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:5bc6f462575a9b3ad6c58fb63ae7be44f3ef10232eb49566c63a461d1ffd0d4f","observation_id":"f9f12e04-89a8-4707-a8c8-a7cea08d65a3","resolution":{"observed_at":"2026-08-16T12:40:01.474722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07253","last_updated":"2020-06-12T15:07:08Z","snapshot_observed_at":"2026-08-05T10:40:41.198153Z","submitted_at":"2020-06-12T15:07:08Z","title":"Dynamic Model Pruning with Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07253","snapshot_observed_at":"2026-08-16T12:40:01.479454Z","title":"Dynamic model pruning with feedback,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.479454Z"},"links":{"cited_paper":"/paper/2006.07253","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:1753d4a2ce6ac62f16c463aa94e261093d65e01f78038e50ad018235b58104d5","observation_id":"eeb14255-c24c-408c-8437-a2b1da53971e","resolution":{"observed_at":"2026-08-16T12:40:01.479454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.162654Z","title":"Single-shot pruning for pre-trained models: Rethinking the importance of magnitude pruning,","venue":null,"work_id":"222ecaad-c28a-4d7d-a950-18653d3ae11d","year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.484437Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:1b645428954ac6fcf773425bedb021201f63094802470e2badf34746b370b377","observation_id":"1ab2105b-d984-4bf5-a5f1-82535f07fb4e","resolution":{"observed_at":"2026-08-16T12:40:02.168168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.144943Z","title":"Resource- efficient transformer pruning for finetuning of large models,","venue":null,"work_id":"d381f5cc-2ba5-4fde-8669-310d771361ff","year":2024},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.489089Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:02d2895fdeb82d05847349a8f745e7634bd87143d8aff203f7ba467034390fba","observation_id":"175af5f5-08f8-440a-92db-bd0b027f9159","resolution":{"observed_at":"2026-08-16T12:40:02.150004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.128894Z","title":"Martello and P","venue":null,"work_id":"bd2a10c4-f4ad-4883-9dd3-8c1239eac316","year":1990},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.493907Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:ec9a443583fb29e0403f29bda91a5bafbf38990091a6b119105a271d8f49f302","observation_id":"a8d6db2d-79ac-45cb-ba58-e75a61e57f95","resolution":{"observed_at":"2026-08-16T12:40:02.133939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.113454Z","title":"A class of generalized greedy algorithms for the multi-knapsack problem,","venue":null,"work_id":"f9ce6d91-f324-471f-b190-dd9f64d7c3e2","year":1993},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.498626Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:57495ae30be6c9b92f2ba10e61c4ed89b57017277c8f3c80cc7753284133f5f0","observation_id":"10bfffd0-03f8-4671-b402-0ab5a23e6dd0","resolution":{"observed_at":"2026-08-16T12:40:02.118280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.097597Z","title":"Dynamic programming revisited: Improving knapsack algorithms,","venue":null,"work_id":"7ee6d4f8-ff8c-4eba-b10e-222fa779aef2","year":1999},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.503067Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:91d2e3fa4e2f5f2ca244d397b10a7940e59f6fc2ae11fddd3661c96bf61c18b6","observation_id":"33ba2ba8-7552-4e28-a629-1a4b909625ba","resolution":{"observed_at":"2026-08-16T12:40:02.102410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.082074Z","title":"An approximate dynamic programming ap- proach to multidimensional knapsack problems,","venue":null,"work_id":"12d7b6d7-4026-45de-9fd0-4cd6588271ca","year":2002},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.507570Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:5fdd785625f216750aa72147f33f4f3826b583c2a2c82c17d070bfc192f20f97","observation_id":"56e54159-64e2-4182-ac57-1cf760711725","resolution":{"observed_at":"2026-08-16T12:40:02.087031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.512195Z","title":"Pytorch image models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.512195Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:fe2895e684c9d37b95825f3c65694fe55237fdf0b83bda7b2f7ab275b9bd2a33","observation_id":"894fd2b9-442b-47c7-a8bc-b9890dacd224","resolution":{"observed_at":"2026-08-16T12:40:01.512195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.054779Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":"a3e64d84-ca5e-4232-9439-a793a51e3f85","year":2019},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.516879Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:e21f28479add04f090805dd6609adec659a7daa6bd3975f4af6ae96bb6ef853f","observation_id":"85a95a5f-ce58-4558-9e6a-e90d1ab14813","resolution":{"observed_at":"2026-08-16T12:40:02.060041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-16T12:40:01.521699Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.521699Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:1f777dc79d7e1c725b3aceb30f94da39e8c6177d004c87ea993a66737bd9edde","observation_id":"71ca0b38-9469-4d83-9c36-cc4b77b0b685","resolution":{"observed_at":"2026-08-16T12:40:01.521699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.039090Z","title":"Where to pay attention in sparse training for feature selection?","venue":null,"work_id":"53af63f2-fbec-4ab6-8a7e-b21cced39367","year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.526599Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:b31e1bfbe831dcf122b8f5b705cc7ffd293003799704ed393e6e37f290206df2","observation_id":"bcab0ed5-41ea-4fbb-9e57-1557970f507c","resolution":{"observed_at":"2026-08-16T12:40:02.044084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-16T12:40:01.531151Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.531151Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:595ed107121a3b832c7b8d2ec2ebc3636c584775e1e91e139cb5a9668453b77b","observation_id":"5ef3de64-789e-440e-8201-99704436b26f","resolution":{"observed_at":"2026-08-16T12:40:01.531151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.536230Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.536230Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:e4471d4ebf3f82dc24c8c532987e0492ec4231c7eba969edf118cd69dc948ba7","observation_id":"bb564558-b981-491a-8465-66bf03934ff4","resolution":{"observed_at":"2026-08-16T12:40:01.536230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.540973Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.540973Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:e83aabf626fc89b73f6f217f806fe301614b0e1185e9e02256fb6e2224ebf399","observation_id":"7bc1e12c-f978-4af8-a3a0-f45e3d1e71a4","resolution":{"observed_at":"2026-08-16T12:40:01.540973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.15082","last_updated":"2021-08-09T15:33:59Z","snapshot_observed_at":"2026-08-16T18:20:48.703235Z","submitted_at":"2021-05-31T16:12:44Z","title":"M6-T: Exploring Sparse Expert Models and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.15082","snapshot_observed_at":"2026-08-16T12:40:01.546388Z","title":"M6-t: Exploring sparse expert models and beyond,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.546388Z"},"links":{"cited_paper":"/paper/2105.15082","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:0d6536a208d3dbbbd7e8ebd8e925311cdbfc7ccd0c17a03b56bf495645d7446c","observation_id":"0c8373a6-2710-4d9c-ad0b-523a863bc711","resolution":{"observed_at":"2026-08-16T12:40:01.546388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-08-16T17:50:47.632734Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-16T12:40:01.551591Z","title":"Taming sparsely activated transformer with stochastic experts,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.551591Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:0c569321d7b0ddecdd608da6b4121027e0bb3b15c6a2f0b729ae6a2956c6e8ff","observation_id":"aee6c30a-1aff-4e7b-9b8a-135de7eab909","resolution":{"observed_at":"2026-08-16T12:40:01.551591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:02.001926Z","title":"Hash layers for large sparse models,","venue":null,"work_id":"e374b2d1-c255-4765-b0da-d884e0788fa6","year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.556853Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:454b592e5739a36d6306d005403fe04445cb9e30eb3c57b5f60acf34731a466e","observation_id":"0050a150-c160-4e2e-b3ed-daaa81272531","resolution":{"observed_at":"2026-08-16T12:40:02.006695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02340","last_updated":"2019-02-23T07:45:29Z","snapshot_observed_at":"2026-08-16T06:51:50.505762Z","submitted_at":"2018-10-04T17:39:58Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02340","snapshot_observed_at":"2026-08-16T12:40:01.561592Z","title":"Snip: Single-shot network pruning based on connection sensitivity,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.561592Z"},"links":{"cited_paper":"/paper/1810.02340","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:628120b638dc504c7049cc5dff9f4931737dd22169a2cc27475968ebc8fd77e6","observation_id":"2fdb58dd-8b11-4296-a9a1-d46c85de0cc2","resolution":{"observed_at":"2026-08-16T12:40:01.561592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-10T04:53:00.900945Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-16T12:40:01.566591Z","title":"Picking winning tickets before training by preserving gradient flow,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.566591Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:12d1775d94a9324ef83ec19ed603c3ccf28bc6ad6811d92ff64d2718fcc97cf0","observation_id":"691ce3dc-2c8d-4d70-971d-cd7ec6a0d0c9","resolution":{"observed_at":"2026-08-16T12:40:01.566591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.571670Z","title":"Learning both weights and con- nections for efficient neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.571670Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:71b43494f84e54dfcdbe633e430e7c2ce65ce1fb2b7c63b6b57a3e3fa235e4ae","observation_id":"87a996e3-6500-4902-9882-304c8bec13aa","resolution":{"observed_at":"2026-08-16T12:40:01.571670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.973423Z","title":"Dynamic network surgery for efficient dnns,","venue":null,"work_id":"dd6bcc25-7e36-435f-91ef-4dd6c57f7b63","year":2016},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.576409Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:b6467c3301f849417db02605fda168cf4c02282c981bbff44139c0f8862b0094","observation_id":"a2f50ac5-1285-4a8d-b766-85a488798fb9","resolution":{"observed_at":"2026-08-16T12:40:01.978419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.957989Z","title":"Compression-aware training of deep networks,","venue":null,"work_id":"c0eebb80-757a-4396-8101-42a9b725ea09","year":2017},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.581071Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:46ac613e8175163507fec8cb86bee4cafd2d62a0954d89d655e644725a22d658","observation_id":"1d97bb73-1bef-4b96-a880-e413ea0a24fc","resolution":{"observed_at":"2026-08-16T12:40:01.962721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.942337Z","title":"“learning-compression","venue":null,"work_id":"d15af60d-dc86-4fcf-8034-668cca4647e2","year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.585807Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:f79b47ce228cbd5f564646fc636771f2c223daa9e38a15c33f3c67f3c058fc7c","observation_id":"758b4354-cabb-4fbd-b152-cb64229f978a","resolution":{"observed_at":"2026-08-16T12:40:01.947063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03635","last_updated":"2019-03-04T15:51:11Z","snapshot_observed_at":"2026-08-14T19:37:43.556604Z","submitted_at":"2018-03-09T18:51:28Z","title":"The Lottery Ticket Hypothesis: Finding Sparse, Trainable Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03635","snapshot_observed_at":"2026-08-16T12:40:01.590570Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.590570Z"},"links":{"cited_paper":"/paper/1803.03635","citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:407671635d7f9c0c0fbdad75255816deb443dbfaf7c4550d73a6a592c8f07b31","observation_id":"49c00761-95bd-49c7-88a0-208a1f28b007","resolution":{"observed_at":"2026-08-16T12:40:01.590570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.925960Z","title":"Efficient lottery ticket finding: Less data is more,","venue":null,"work_id":"20e417e4-7c40-447c-b9ab-e98a69264f4f","year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.595807Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:5cc6b9f33fb845faa3891c9f9bdc0db99324925034e957197220b22dee9e8a2d","observation_id":"02b0f596-11a5-4078-b95f-c9a752d8a809","resolution":{"observed_at":"2026-08-16T12:40:01.930852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:40:01.907525Z","title":"The lottery ticket hypothesis for object recognition,","venue":null,"work_id":"22096a31-f0c3-425d-9e83-bac217bc6529","year":2021},"citing_paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:01.600260Z"},"links":{"citing_paper":"/paper/2504.12471"},"observation_digest":"sha256:493fde2de094de1cefcc7e74c09aa58b2ec8d8896a4513f13cc1d3627524f761","observation_id":"2601157b-698e-4da9-97c2-fcb0decdc4d9","resolution":{"observed_at":"2026-08-16T12:40:01.914443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12471","last_updated":"2025-04-16T20:18:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T12:28:41.569237Z","submitted_at":"2025-04-16T20:18:15Z","title":"You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2504.12471."}