{"as_of":"2026-08-10T11:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1613ce10aa1297d764c86a69cbd710deb832514d0c9bca8601317123b0f3a39","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:36:04.095237Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24241/citation-record","integrity":"/paper/2505.24241/integrity","json":"/paper/2505.24241/citation-record.json","paper":"/paper/2505.24241"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:35:56.815675Z","title":"Gpt-4 technical report.ArXiv, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:56.815675Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:40301059b1ab404d08f06c2289a17bf43e3e583c7da92144a9b943383460bf07","observation_id":"1f61e9e3-18a0-4949-819c-8c3922f02abd","resolution":{"observed_at":"2026-08-07T12:35:56.815675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T12:35:56.859950Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:56.859950Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:602a3bf20141f651d076ac6a483c83cb0ad9f8a2bf3bfe9fc77b265bc144d27b","observation_id":"9d46bd6f-28b3-49fd-bea7-a1c13c9f70dd","resolution":{"observed_at":"2026-08-07T12:35:56.859950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:35:56.928598Z","title":"Llama 2: Open foundation and fine-tuned chat models.CoRR, abs/2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:56.928598Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:480b242b0b1c784b29083b740e5061065e520ff75556ef3e682e197bc2c08292","observation_id":"a388e5db-f362-4c17-89a9-a1494ffec41b","resolution":{"observed_at":"2026-08-07T12:35:56.928598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:35:57.077405Z","title":"Llama: Open and efficient foundation language models.ArXiv, abs/2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.077405Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:d7bc26c3528f636a5067587aeca1282e8a398344c8e6197e7762bec79c52a7ef","observation_id":"742de2b7-24dc-4ade-81d7-82cbb3fce188","resolution":{"observed_at":"2026-08-07T12:35:57.077405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.873260Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":"34bbb969-42a5-4b57-9d66-4bcdc45b553e","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.230302Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6de058d30d519ebbf2462a10d354334cd09fed935a01ac50381329852d21c64f","observation_id":"f948af2c-4bb5-421f-9f82-4ffd50071216","resolution":{"observed_at":"2026-08-07T12:36:12.975629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:57.387978Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.387978Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:b56d3ef0a030b0e99eccdf0ae83fbcfbe3ec295fc3facdab818dafcb5ff2a99e","observation_id":"cb7c4bf5-47f7-4534-a993-ac93f25e78aa","resolution":{"observed_at":"2026-08-07T12:35:57.387978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:57.526418Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.526418Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:e18b8f9555b6f3af15aeb352054e6258b2345547f3c17390e4e7a2fe6e44716f","observation_id":"ce26dad9-fd19-49e8-9d8c-6e15fde7f1a8","resolution":{"observed_at":"2026-08-07T12:35:57.526418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:57.693685Z","title":"Smith, Iz Beltagy, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.693685Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:9bbf4a5a81f8cea9f5c9eebb8529a1be33dd52546fba588d30df65cf2c470d75","observation_id":"8835867b-243b-4f17-94c3-99f3818dd42a","resolution":{"observed_at":"2026-08-07T12:35:57.693685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.585734Z","title":"PiSSA: Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":"53f83af9-cbfd-4238-becb-9cb7e26e6805","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:57.853270Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:415955928efc41edd8c30b3be5d612c55d3b235b62e8e01d6a5c9d81aee41dcf","observation_id":"c10ed9c0-f874-468a-9545-084becb81d9e","resolution":{"observed_at":"2026-08-07T12:36:12.715904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.279808Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks","venue":null,"work_id":"fb3ac7a4-7815-41c0-b518-e34797ed44f9","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.009136Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:bafe18e441d1ac0dc03507731dd13cd8f9ad080088587475b33e710aeedef31a","observation_id":"016d757b-1a1d-4f55-a4b2-6e9a78f6e201","resolution":{"observed_at":"2026-08-07T12:36:12.393486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:12.012691Z","title":"A win-win deal: Towards sparse and robust pre-trained language models","venue":null,"work_id":"97247c08-8c68-4227-9e63-4cea701b94be","year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.167465Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:2c7659874cfbc09da4a38211b44d0bb68897ccd2211c97868ccc8746016098d1","observation_id":"5ae5f2e7-603b-43ef-871a-03993a2e9118","resolution":{"observed_at":"2026-08-07T12:36:12.124879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:11.760374Z","title":"The lottery LLM hypothesis, rethinking what abilities should LLM compression preserve? In The Fourth Blogpost Track at ICLR 2025, 2025","venue":null,"work_id":"c99cbd50-ff5c-478c-8fbd-715950bb5754","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.290700Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:08b6c3caa4f8603d7edd18f25cf4ce72361fe3cb4c9f5b59a2c0010ae2911625","observation_id":"e0907c83-b83c-4b63-8a8f-06d9867c76f8","resolution":{"observed_at":"2026-08-07T12:36:11.886754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:11.542843Z","title":"LLM-pruner: On the structural pruning of large language models","venue":null,"work_id":"597cb5a7-f2cf-44d7-a892-8642a6b193d2","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.477227Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:fd88a8680935f7cff25d6ea49087280258d0cf4a37616db65e43e40ef7927c14","observation_id":"f03907e4-aaae-4ae3-8829-63c601ff2a46","resolution":{"observed_at":"2026-08-07T12:36:11.635534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:11.321050Z","title":"Fluctuation-based adaptive structured pruning for large language models","venue":null,"work_id":"59ee2a3b-4640-48b0-b332-56df447b6aab","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.569539Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:bf5636a4c98c5f00932e266052a2da48c643a2d9b3c46a10f226345bad8def13","observation_id":"2d14abcc-74bd-4312-9a0b-3f033c82e42a","resolution":{"observed_at":"2026-08-07T12:36:11.447956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.992391Z","title":"Discovering sparsity allocation for layer-wise pruning of large language models","venue":null,"work_id":"b6995017-6b4f-49ee-b905-cd2c3ec1182e","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.638519Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:59034c20dee897966586e006e69f0cc9744e42d12cca66c9d4aa0f255267f1fc","observation_id":"10f192e8-6c95-49ec-8cba-3957c4c26e2a","resolution":{"observed_at":"2026-08-07T12:36:11.143106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.727119Z","title":"Structured optimal brain pruning for large language models","venue":null,"work_id":"81d0e706-1ae4-4a94-a9bb-bfb375c9ca84","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.709791Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:55c63eac48ce52d44203df9e39b27847cd1ee257507b1fd73e599b72a92f2011","observation_id":"4c484cda-1cc6-4e17-a064-9e99430fe594","resolution":{"observed_at":"2026-08-07T12:36:10.831673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:58.796366Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.796366Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:ccdf0c2728b7bf1554efb7e9e005b1144f2d20324d43b29c6db16886361f3a13","observation_id":"2484238b-6924-481f-946c-aa49e58e034a","resolution":{"observed_at":"2026-08-07T12:35:58.796366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.413195Z","title":"Dauphin, Angela Fan, Michael Auli, and David Grangier","venue":null,"work_id":"608214d7-bad4-4a6c-a299-0a472dbe77f7","year":2017},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:58.876972Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:30304a27546d144c46eafa1ae9c72271caf6270ac36280f602e7082b3a894c65","observation_id":"72d6fe9b-f0c2-4744-bd7f-0c1c46868ad5","resolution":{"observed_at":"2026-08-07T12:36:10.556850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:35:59.010249Z","title":"Training verifiers to solve math word problems.CoRR, abs/2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.010249Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:09f396898acf4ee62151cfc8714dc7b808d286d1f491dc3140e1ab0654bb86f1","observation_id":"4fa1618f-07bf-4229-aa90-2c63742e8592","resolution":{"observed_at":"2026-08-07T12:35:59.010249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:10.107677Z","title":"Sheared LLaMA: Accelerating language model pre-training via structured pruning","venue":null,"work_id":"93921562-a5c7-4d1c-9c59-e0a4a0e31bbc","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.119774Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:77545e13056299e55ec1181aa1b2b1c7398a49b2a2095ec678bfae3599867563","observation_id":"650123d3-1d61-4ca3-a9d6-edcae2f4688f","resolution":{"observed_at":"2026-08-07T12:36:10.248620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.819773Z","title":null,"venue":null,"work_id":"352e40a5-ce59-420a-8e3b-8aef0f4d5179","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.228309Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:cb885f1c5becf3bc7e47dc526b5e9e685c1ba842dbd39e9d2eaa648c427d0624","observation_id":"5ec6d921-84ec-4169-b42d-ea7196ee9be6","resolution":{"observed_at":"2026-08-07T12:36:09.978283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:59.337320Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.337320Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5d9bfec74a40e8a511e0c2975b6f63e1e1170aace31f0153f2d4fc6d03eab3d6","observation_id":"e63e96c0-a028-4d23-9465-f47306c1e1c5","resolution":{"observed_at":"2026-08-07T12:35:59.337320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:35:59.443637Z","title":"Massive activations in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.443637Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:3d64d8e2f875ec32cef3cee90b2b963d8dfe6c5c7ece66a59c8c273f82846d50","observation_id":"eacbb448-9f19-4ecc-a9de-f2cf79ddf2cb","resolution":{"observed_at":"2026-08-07T12:35:59.443637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.528141Z","title":"Learning to grow pretrained models for efficient transformer training","venue":null,"work_id":"bd9c328e-d89c-4b7b-844b-e71e5e213a57","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.526167Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:1cb3a9168a7338df94c4bc74d06b04497626b06656930d3bb1e744428a8fc7d2","observation_id":"63bf374b-0387-4f0d-be25-b6930384cae1","resolution":{"observed_at":"2026-08-07T12:36:09.691397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.287020Z","title":"LEMON: Lossless model expansion","venue":null,"work_id":"ad159003-7cd3-4943-9cab-582a4f5f8091","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.606704Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a46cbece73586bf4e4df0a5045e58fbf037246b73c7fe894958a7d7a095197a4","observation_id":"b1e2a199-25e4-4da0-955c-8541b01e3a29","resolution":{"observed_at":"2026-08-07T12:36:09.380874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:09.058750Z","title":"Compute better spent: Replacing dense layers with structured matrices","venue":null,"work_id":"bad5bf00-e13c-42ac-b1c2-412d16d59819","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.683091Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:1c38d524dbac9bce250701dfd18649c9e48d472519231ad732907e2666ddf3b3","observation_id":"6061590e-d9fd-4eec-94bb-22b8f3a80fdc","resolution":{"observed_at":"2026-08-07T12:36:09.138413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:08.837256Z","title":"LEMON: Reviving stronger and smaller LMs from larger LMs with linear parameter fusion","venue":null,"work_id":"67e17ca7-57a3-492a-b4d0-97d6fb9eea73","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.760216Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c29df9a518cc1341f615caf43bc256d5675d043cee5bfe8f84d4fcee17c86466","observation_id":"bceaa59f-f172-424d-b3d3-1d9f58602c0b","resolution":{"observed_at":"2026-08-07T12:36:08.960278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:08.489281Z","title":"Effective rank and the staircase phenomenon: New insights into neural network training dynamics, 2025","venue":null,"work_id":"6f69d782-b0ea-4794-9ade-90221e17c3e7","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.864612Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a104c850fea9239559bf39327c0a4a350a0451b56e5918a118a824d86cadb65e","observation_id":"fac36b7d-b935-403a-bbf7-36c4f179ea39","resolution":{"observed_at":"2026-08-07T12:36:08.638877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:08.244960Z","title":"Goodfellow, and Jonathon Shlens","venue":null,"work_id":"bea952e3-f6f1-4848-a686-989c3fd0875a","year":2016},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:59.938767Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:9dc13d3cec4556f83dc09ff47add28e03361bbc75068f5d61a7ff44e14cb65ab","observation_id":"8db2113f-0267-4848-a5d8-31ecd36094ba","resolution":{"observed_at":"2026-08-07T12:36:08.359927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.956413Z","title":"bert2BERT: Towards reusable pretrained language models","venue":null,"work_id":"85f4b416-88d1-442d-90e5-760efa5ae77d","year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.037893Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6b2dd578f2898ac3d3cf6550f6614e025a3904dcb5e86b4cc47669a02896ceaa","observation_id":"0ffc6760-6e03-4267-8169-e38e41917817","resolution":{"observed_at":"2026-08-07T12:36:08.113687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.614659Z","title":"Peters, and Iz Beltagy","venue":null,"work_id":"02199e65-cedd-4b38-85b8-cf9a27fcf472","year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.144762Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:5147b874a25967fb04d9950effa46fa1aed0f0406b372732e2b19087f0ba6f76","observation_id":"dd426ef2-0e13-4661-93d2-4ad122fb230f","resolution":{"observed_at":"2026-08-07T12:36:07.770154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.323380Z","title":"Hft: Half fine-tuning for large language models, 2024","venue":null,"work_id":"2cf03e62-458c-4a51-9b5e-b93f7136d6ef","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.223463Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:3e9b367c1de3ad59408bdfd6190f3f3f46ab7bc36b502b089f84675fe2a87af8","observation_id":"dbb7f8e8-d78c-47d3-bc55-4a20ab76b68d","resolution":{"observed_at":"2026-08-07T12:36:07.462526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:07.046575Z","title":"Enhancing large language model performance with gradient-based parameter selection","venue":null,"work_id":"10f5d549-bf1e-49c8-b6aa-3d333e649631","year":2025},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.328789Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6f7a865db24f5b62a5b14fc6df296050121d350ac5351ef5d2af92daf198022a","observation_id":"2ba83c9b-f77e-499c-b9dd-ba4591d5aa50","resolution":{"observed_at":"2026-08-07T12:36:07.170080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.427766Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.427766Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:2634ce6572c29afb6d1f0026116c49e7c24dc3d30a72ede944888b180acf4af0","observation_id":"c3a61b63-516d-40cf-8a68-1c758f9fd636","resolution":{"observed_at":"2026-08-07T12:36:00.427766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.506110Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.506110Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:f9176319356e281b71a419f602c3da886d267bd142452a917d0a1ba8e3eef40c","observation_id":"13151836-33de-4cdd-9b42-a2291e2bc32a","resolution":{"observed_at":"2026-08-07T12:36:00.506110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.650525Z","title":"Challenging BIG-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.650525Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:2b92dbb1be693c356b538f5a319c35cc4746c30f9f0fe1205eef70d2060dd44b","observation_id":"fd6d97c8-fd4c-44af-b3a6-9f963ccc9af6","resolution":{"observed_at":"2026-08-07T12:36:00.650525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.725896Z","title":"Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.725896Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:0d2965fd59153f680ecea6c00ee40617829ebd137d4d096b104760029a857a81","observation_id":"87e53b83-0471-473b-a5ea-6c1c56dac2d5","resolution":{"observed_at":"2026-08-07T12:36:00.725896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:00.831653Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.831653Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:f7b4720ba768c4eef05d60b4ffe702b469ebb0a2dfc632c049c7402e057d02e4","observation_id":"47aadd0f-700b-4537-bc65-3938183992d6","resolution":{"observed_at":"2026-08-07T12:36:00.831653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:36:00.938599Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:00.938599Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:b8b89868d822221d2b6ebddb4a60fc1f475100d3bfc26053756b2d190d9791c3","observation_id":"45a41d81-7f4d-4fcc-926b-2df1041e9610","resolution":{"observed_at":"2026-08-07T12:36:00.938599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.779209Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":"b8ec6fdf-f52a-4669-bdd7-56bc587a6928","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.021295Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:a9d39eead6435efe81ae80e388e2ca7df573fa16ac4b10d87d11d77b43cc0902","observation_id":"19f4c7f3-ae2d-4fc8-bc2d-3d1f8bd3fe84","resolution":{"observed_at":"2026-08-07T12:36:06.907705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.487393Z","title":"DoRA: Weight-decomposed low-rank adaptation","venue":null,"work_id":"a7833933-c3ab-46d0-9062-b0bc0e6e8335","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.122294Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:37271f1a1f331b31f4c18ec885286ce6e12d5645195734110161bd1dda52fba3","observation_id":"a1b38288-16e9-4da4-a615-a83fb2334782","resolution":{"observed_at":"2026-08-07T12:36:06.644737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.236896Z","title":"ReloRA: High-rank training through low-rank updates","venue":null,"work_id":"28973135-013b-4660-b600-2f7019be9bb8","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.235887Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:dedcba6b0bfa8200c3ca314a44dbdc87697c0839e35a5f701fc098d5b0947438","observation_id":"f889c35a-adb1-4327-aaff-d279e74be74e","resolution":{"observed_at":"2026-08-07T12:36:06.344360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.209802Z","title":"S2ft: Efficient, scalable and generalizable llm fine-tuning by structured sparsity","venue":null,"work_id":"94c3ed74-d339-4331-a49c-1d477025bd90","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.342708Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:9d97638c2f830a6cbf6e3f37f4a61997cd9dc4c676fbe094df226a2b99ed6a7f","observation_id":"c4a3b13a-206f-4367-8b78-c5c51632f429","resolution":{"observed_at":"2026-08-07T12:36:06.222422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:01.460218Z","title":"Tinyllama: An open-source small language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.460218Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c9abab314a7721a301a62c92fad455b7a6aa12d37c3132641d0359a367bbaa8a","observation_id":"16cc2191-c65c-4366-ba84-f2f699844d43","resolution":{"observed_at":"2026-08-07T12:36:01.460218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.104127Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":"9d4d1a47-7acd-4843-ab51-6315f7819799","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.569207Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:ea9ea0286da78a1d33545e837c93ffe16574bb31f8a3d2122e35f6be6f0e78c5","observation_id":"f4fed23d-1319-4957-b585-2b5006bb67d3","resolution":{"observed_at":"2026-08-07T12:36:06.149961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:36:01.681225Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.681225Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:b6c7c76602a6f6e11279b53543478b644d92b93250decc91a6deebec47936790","observation_id":"0847a323-50ac-4a9d-937e-84d0acea18d9","resolution":{"observed_at":"2026-08-07T12:36:01.681225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-07T12:36:01.791886Z","title":"The lambada dataset: Word prediction requiring a broad discourse context.arXiv preprint arXiv:1606.06031, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.791886Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:6d864b5f638f1c0527d4e164363d6e884ddd39d6222e421d2d3cb08f574eb607","observation_id":"eb685274-3caf-4b20-9d74-0e8c70897eda","resolution":{"observed_at":"2026-08-07T12:36:01.791886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-09T06:25:20.879304Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T12:36:01.860011Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning.arXiv preprint arXiv:2007.08124, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.860011Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:111ec3d6ea2642a523cee45e9491a9c8264398a8bfc17260a413d3e16cea2143","observation_id":"fd506fb8-9f57-4aa0-a05e-d85de6cee7d4","resolution":{"observed_at":"2026-08-07T12:36:01.860011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:06.003591Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":"f245b5cf-e00b-4114-bb7e-c3842862e766","year":2020},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:01.968858Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:eea8ffac74f7c00987e7d7ab662ad70e9611fcf2cfc9f8f6839efd35ca7042ea","observation_id":"d9d8875b-f698-4f93-90b4-436eee36fbe0","resolution":{"observed_at":"2026-08-07T12:36:06.045296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:02.070662Z","title":"Liu, and Matt Gardner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.070662Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:94bb26d826ebcb409d513403af7632894951ad3c422540893ea838ef15ce320e","observation_id":"b084aeb5-8f4f-46e9-ba5d-ba4a173d4eea","resolution":{"observed_at":"2026-08-07T12:36:02.070662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:02.148445Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.148445Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:f722878cf8698caf6a86e23c0b0e1296b0eb5df43e21e87909c0522c8769891d","observation_id":"e6d28d96-1c89-4f0f-a250-ae643ed8d2fc","resolution":{"observed_at":"2026-08-07T12:36:02.148445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.888266Z","title":"Hellaswag: Can a machine really finish your sentence? In Anna Korhonen, David R","venue":null,"work_id":"d64583de-5aac-4394-9dc6-0f823c7d081d","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.254474Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:01e84657b6901852e66cbb952c04dc237643ec9ebda708f0cb53fd5fb4cde767","observation_id":"88d4196c-f627-4690-955e-02b5f362d57b","resolution":{"observed_at":"2026-08-07T12:36:05.937552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.780150Z","title":"Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming-Wei Chang, Andrew M","venue":null,"work_id":"fce26815-7f3b-41ab-a797-54ffdbf83a15","year":2019},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.366029Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:9d26db00935f8851942428da493edaed4c7b2fec29d3fddcb68d6b21f6910a76","observation_id":"cb37b043-42b9-40fc-b629-463701300ea5","resolution":{"observed_at":"2026-08-07T12:36:05.828632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.651497Z","title":"Learning to grow pretrained models for efficient transformer training","venue":null,"work_id":"1158b78d-421a-41d5-bb13-c27958949faa","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.464462Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:04b420c9f34f5fbab9e72360e7a2d7c305d464247346080751893b4adbf48d9b","observation_id":"f5c64eae-1e07-464e-bb4f-a00198043064","resolution":{"observed_at":"2026-08-07T12:36:05.725310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.499104Z","title":"Scaling smart: Accelerating large language model pre-training with small model initialization, 2024","venue":null,"work_id":"d7738f52-10c2-40cf-b83a-77d6ec1eae5f","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.551364Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:c84ea5b271dd9f4cb1e4faa41130d28390b41d00ccfcbc61b8bc669fbb19846d","observation_id":"edaeab5a-93e2-42ac-9b31-451cc37f11f8","resolution":{"observed_at":"2026-08-07T12:36:05.585053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:02.641265Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.641265Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:450ab13a95f4bfb2ab04c4cb0a4aaba2982ac96279df4f89adfdfe106c0780ce","observation_id":"598d78ce-bc8f-4b66-815c-ed79b1be4e7a","resolution":{"observed_at":"2026-08-07T12:36:02.641265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.381029Z","title":"Parameter-efficient transfer learning with diff pruning","venue":null,"work_id":"9e254723-b643-4def-a1ad-a70b07130e49","year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.733634Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:dc69f308c8a95666767de399d100a6a9a5f11825508f6ed7d4d430bea1e17b65","observation_id":"0ea1ddef-4d6d-4ab5-b4cf-47c4f6b43f7b","resolution":{"observed_at":"2026-08-07T12:36:05.442392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.231650Z","title":"Training neural networks with fixed sparse masks","venue":null,"work_id":"d40679dd-967c-4612-87aa-272c08a0a024","year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.819550Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:e8d78614d252c51f18db335afb462856e71a8e75201995e5519becf88f1bb5dc","observation_id":"75f589f9-b90d-4873-a779-047b624455da","resolution":{"observed_at":"2026-08-07T12:36:05.310344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:05.122627Z","title":"LoRAMoE: Alleviating world knowledge forgetting in large language models via MoE-style plugin","venue":null,"work_id":"31e3a8b4-c96d-4268-9a3e-6eec01dd0151","year":1932},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:02.916562Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:26a29720a32b2b87b3d1b28b87e295a277a746faf1f301633d2cf4cf29e80c53","observation_id":"093b258c-5123-43bb-9923-a5fa2272b0d5","resolution":{"observed_at":"2026-08-07T12:36:05.178736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.008625Z","title":"Open llm leaderboard v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.008625Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:9c889846c7ab1b4d8678a3b4949854d1a08fbc122ba24f3d753fe38bd9aedad8","observation_id":"1e9fb02a-8604-4f43-96d7-2373da49bb66","resolution":{"observed_at":"2026-08-07T12:36:03.008625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.074193Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.074193Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:1dc40448e01dbfabedaf2d637275606b3effdc78ea3d292626ef90c7461ddd5d","observation_id":"60bab649-cf82-4e8e-b539-38e4d438d58f","resolution":{"observed_at":"2026-08-07T12:36:03.074193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.145796Z","title":"Openassistant conversations – democratizing large language model alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.145796Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:ad92b0172a8750062c49363bc3113e3f31891e214590c30661fe23162659ea77","observation_id":"b744294a-9da6-412b-82d9-a1c3ef8ee8b8","resolution":{"observed_at":"2026-08-07T12:36:03.145796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.223776Z","title":"Instruction tuning with gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.223776Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:4cb675f80dab17a291f6e148795e967f515f8d343bb0ccab0b5f683d82486574","observation_id":"d59716fd-d1ed-4e31-bf53-d803417fc55e","resolution":{"observed_at":"2026-08-07T12:36:03.223776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.322828Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.322828Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:06d115b051b1e34fd98a9fc57ca71c6c65caefe3cfa29bbb192b04c343d12a96","observation_id":"24e2876f-de3c-43f0-9dae-195d802dab98","resolution":{"observed_at":"2026-08-07T12:36:03.322828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.414462Z","title":"Lima: Less is more for alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.414462Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:62f2af6c0b722198d0797dae585c6c5e452cd431bd3ab5597f10ab95c4f45154","observation_id":"01fe5386-62ca-40ef-82a2-07f015d92e28","resolution":{"observed_at":"2026-08-07T12:36:03.414462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.957085Z","title":"Wizardlm: Empowering large language models to follow complex instructions, 2023","venue":null,"work_id":"c59ecef3-f96d-4159-b1ca-e5c104266a21","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.506893Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:479497215d218aa019f5623e973b2fe2a9f28f225c95e419cd5cabff9698a498","observation_id":"b11bd313-5788-401a-9f0f-e01ad6493522","resolution":{"observed_at":"2026-08-07T12:36:05.021454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:03.573739Z","title":"Orca: Progressive learning from complex explanation traces of gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.573739Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:48aedaae82cad35b89b9cf3413a2f38a13c77e2ca9a4ed507004c1b424b19bf1","observation_id":"606314cf-158d-4628-8818-55b540c64291","resolution":{"observed_at":"2026-08-07T12:36:03.573739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-08-09T04:45:14.956800Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-08-07T12:36:03.689722Z","title":"Llm-adapters: An adapter family for parameter-efficient fine-tuning of large language models.arXiv preprint arXiv:2304.01933, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.689722Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:63a9bebd6395d231d6ea906033944080efa395a54f590161a7f35dd600721ae9","observation_id":"d5b397c3-3d60-4168-8ae1-d4814a079de6","resolution":{"observed_at":"2026-08-07T12:36:03.689722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.779296Z","title":"composer.https://github.com/mosaicml/composer/, 2021","venue":null,"work_id":"df8b6663-e9b3-453d-9aa8-0d16ca72865f","year":2021},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.756912Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:ee6541a8e56bebdd50397baf30fe553d8a4c03dc8186670fa5d28f76724df4c4","observation_id":"7eeb2cf9-8b95-4754-a4be-b9ba879c25bd","resolution":{"observed_at":"2026-08-07T12:36:04.853208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.616463Z","title":"Pythia: A suite for analyzing large language models across training and scaling, 2023","venue":null,"work_id":"da074958-d9a4-4ecd-bfd7-ea3f208a9d58","year":2023},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:03.873182Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:d416aa45171baefe5ca1ecb75df8f7160c66bdf3049b777aef4f391c998309ab","observation_id":"68637e74-e185-4a2e-befc-228cd5ccc64e","resolution":{"observed_at":"2026-08-07T12:36:04.711088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.439304Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":"9efa8296-f8a1-4b60-aeb2-e3f634edfe3d","year":2024},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:04.002718Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:86c7d8bcdc9004d285e2d8b5016eeeee06a93c794f91b3fb9b136289f922c52c","observation_id":"474f2d64-e64a-4264-9ded-cb63ac899a0a","resolution":{"observed_at":"2026-08-07T12:36:04.518059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:36:04.289986Z","title":"[68], we fine-tune them for 3 epochs","venue":null,"work_id":"b486b3d0-0c3a-4f24-a0fa-fb0972295fc0","year":null},"citing_paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models","version":1},"reference_index":8192,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:04.095237Z"},"links":{"citing_paper":"/paper/2505.24241"},"observation_digest":"sha256:85bf1f7d176e0f8d67b3f5e17bc0064da588bc8edb74e6286248222a8897309a","observation_id":"e1820a5a-e5ab-4162-81b9-bf11f68c613d","resolution":{"observed_at":"2026-08-07T12:36:04.368810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24241","last_updated":"2025-05-30T06:06:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T10:52:17.095316Z","submitted_at":"2025-05-30T06:06:23Z","title":"Advantageous Parameter Expansion Training Makes Better Large Language Models"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2505.24241."}