{"as_of":"2026-08-09T03:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1a3089d998413330dda8abc3785c739486d7205e2d28bb864ba866c8d2ec55d","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:03:29.855120Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.04710/citation-record","integrity":"/paper/2601.04710/integrity","json":"/paper/2601.04710/citation-record.json","paper":"/paper/2601.04710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:23.576295Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:23.576295Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:987cab3144f656ff95c1847b2df0bc0f0a1a8615815e0bd56a05accfafd8bf56","observation_id":"8bc418db-0987-4213-b43e-509f1c8cfa1e","resolution":{"observed_at":"2026-08-03T12:03:23.576295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:23.701919Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:23.701919Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:ec8bedcb2b425951ee387f51bc874f28f10b4abb73cdc3a1115b3fa1509181fc","observation_id":"696ba634-0f5a-4d13-9be6-3f2fceb5edf7","resolution":{"observed_at":"2026-08-03T12:03:23.701919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:23.869659Z","title":"Learning represen- tations by back-propagating errors,","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:23.869659Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e23b1fc3acf130b1c2bf9570a3f3380fdcc1ef15810b815a4e714ecd6038a34f","observation_id":"d33d36c0-f368-4953-aa5c-4f176d24b834","resolution":{"observed_at":"2026-08-03T12:03:23.869659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:23.967612Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:23.967612Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e6cca84f4f0475c8877a963ec187aa3a2fa1486b69730f9e98e9ab22c7bc3331","observation_id":"b8d04519-89f3-40fc-bb94-ae4be3d26745","resolution":{"observed_at":"2026-08-03T12:03:23.967612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:24.145588Z","title":"Parameter-efficient transfer learning for NLP,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:24.145588Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:7320aee93a237b5c62e549408deec5d426f489c4b51637a2da85397ab676f8d1","observation_id":"67093e2c-8266-4998-854a-a30b1d8540d5","resolution":{"observed_at":"2026-08-03T12:03:24.145588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:24.316834Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:24.316834Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:eb2292249b6491feba945f44c42f635738d85d1f9e320163d704fc8fcfc090f8","observation_id":"ae92a206-f088-4086-978a-e7b97c424e1c","resolution":{"observed_at":"2026-08-03T12:03:24.316834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-03T12:03:24.487626Z","title":"Opt: Open pre-trained transformer language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:24.487626Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:9926c03fab622c5b6b02e4508b09d3c8636c706d10b030596f7bb58b4b30aa1e","observation_id":"ba402227-bb18-4163-9a4b-0c628bff9e78","resolution":{"observed_at":"2026-08-03T12:03:24.487626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:24.665069Z","title":"Fine-tuning language models with just forward passes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:24.665069Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e00a2ff1126b8644e9c9b4ddabfb9447de7f6dd99b9f37e27d937398872c2033","observation_id":"46aac17f-f4e4-4aa1-b4e5-58ece3de79b7","resolution":{"observed_at":"2026-08-03T12:03:24.665069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:24.867629Z","title":"Sparse mezo: Less parameters for better performance in eroth-order llm fine- tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:24.867629Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:cb4808280b0be80d8ae5acf8b545123a5f4097a92fc5546d5029f35822a0e37b","observation_id":"2906712c-4349-4afb-b3f8-800a2410b007","resolution":{"observed_at":"2026-08-03T12:03:24.867629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:24.993744Z","title":"Zeroth-order fine-tuning of LLMs with extreme sparsity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:24.993744Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:f820dcb9732a65a7517faa9a6aa3bece1a5b3d3cb241cbcd7d10b55858ce042b","observation_id":"f4d38d21-802d-4667-9c0a-76a3c69c5ea2","resolution":{"observed_at":"2026-08-03T12:03:24.993744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15173","last_updated":"2025-02-18T13:45:50Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:11:55Z","title":"Second-Order Fine-Tuning without Pain for LLMs:A Hessian Informed Zeroth-Order Optimizer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15173","snapshot_observed_at":"2026-08-03T12:03:25.119547Z","title":"Secondorder fine-tuning without pain for llms: A hessian informed zeroth-order optimizer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:25.119547Z"},"links":{"cited_paper":"/paper/2402.15173","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:b58e775a73e8f2929dea5ad71a8371d2f9624874820df390ec3b1b36075a3fcf","observation_id":"d7309bff-d0ec-4792-9861-15c047fb8e2d","resolution":{"observed_at":"2026-08-03T12:03:25.119547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:25.263870Z","title":"AdaZeta: Adaptive zeroth-order tensor-train adaption for memory- efficient large language models fine-tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:25.263870Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:8cad12f6cdbcb5e035cbc7bfee08c16a9f473155c50a0d9c9dadf60f46cd889a","observation_id":"8e35bc05-9a69-4ba5-b518-511e6b25e5bc","resolution":{"observed_at":"2026-08-03T12:03:25.263870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:25.397365Z","title":"Multivariate stochastic approximation using a simultaneous perturbation gradient approximation,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:25.397365Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:9b0ca70cb5d72d43479dea434836efc5962ef70d5b369dea3e2c1b0a80b95f8a","observation_id":"6d4a2c37-f464-408f-9364-7f5a1a219d59","resolution":{"observed_at":"2026-08-03T12:03:25.397365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:25.522758Z","title":"Completely derandomized self- adaptation in evolution strategies,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:25.522758Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:089079189358bb12d5b04dbc5d1fe67a6f8d0bc6f8e75aefab92327e8aa8966b","observation_id":"a44133d8-de06-4cc2-9d46-4785b661356f","resolution":{"observed_at":"2026-08-03T12:03:25.522758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:25.716331Z","title":"Black-box tuning for language-model-as-a-service,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:25.716331Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:f2861cf32c4c5a3aec0776cf3e31a26a29e6c612caf0d07ad94de94c938917c2","observation_id":"61b9ca1d-36b1-42db-98c2-6a4341b0f1e0","resolution":{"observed_at":"2026-08-03T12:03:25.716331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:25.888334Z","title":"BBTv2: Towards a gradient-free future with large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:25.888334Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:c34c9f5f4477e0a02e7a81c9b242b74ae60c23a43351e0b2c2d9514d23e54b24","observation_id":"ed2f91a0-8344-422a-9646-ecbd8dc6be7c","resolution":{"observed_at":"2026-08-03T12:03:25.888334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:26.014227Z","title":"Derivative-free optimization for low-rank adaptation in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.014227Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:2240b33f49bc331384d868da49175fe9248c484db7141e0c67dc13e3cadfa1c1","observation_id":"f2830cba-177a-4f66-81b7-65ebba365443","resolution":{"observed_at":"2026-08-03T12:03:26.014227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-07-06T10:33:17.427927Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-03T12:03:26.187156Z","title":"Zero-offload: Democratizing billion-scale model training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.187156Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:17f58edd8fb75f88e7c44aabf05eee7e402f3116d52ab25e9efa6acecd450335","observation_id":"7d326a68-20bb-44e4-b59a-0e462889b87f","resolution":{"observed_at":"2026-08-03T12:03:26.187156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:26.305970Z","title":"Bpipe: Memory-balanced pipeline parallelism for training large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.305970Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:92d80c8fd30d28e644d79073dc47b8f15086917cb5e6a57ece9ad2121f07d1bf","observation_id":"73f91e4e-3624-4c19-ab60-c319fa7219c1","resolution":{"observed_at":"2026-08-03T12:03:26.305970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:26.399307Z","title":"Deepzero: Scaling up zeroth- order optimization for deep model training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.399307Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:d2bb6e604745bb94663752bec23abdeed66f496676173da56a8689f935d79873","observation_id":"896a477e-4aca-4b48-9fdb-9bf1717064c7","resolution":{"observed_at":"2026-08-03T12:03:26.399307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:26.513343Z","title":"Distributed zero-order algorithms for nonconvex multiagent optimization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.513343Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:67818f96ffc8312fb1253cc6b1ecb7b5ec6088cf3030904ee62ac3a99f266ac2","observation_id":"f3527265-8822-48ce-831b-999f566a6af5","resolution":{"observed_at":"2026-08-03T12:03:26.513343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.10707","last_updated":"2021-06-11T04:30:50Z","snapshot_observed_at":"2026-07-06T10:43:21.381832Z","submitted_at":"2021-02-21T23:06:35Z","title":"A Zeroth-Order Block Coordinate Descent Algorithm for Huge-Scale Black-Box Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.10707","snapshot_observed_at":"2026-08-03T12:03:26.677740Z","title":"A zeroth-order block coordinate descent algorithm for huge-scale black-box optimization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.677740Z"},"links":{"cited_paper":"/paper/2102.10707","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e290e44e234469e1392d9ab888b5087a1eebd28f168206a5ca560fe8808f74cf","observation_id":"d7c96db9-373c-48bd-9421-26a9105925f9","resolution":{"observed_at":"2026-08-03T12:03:26.677740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:26.813019Z","title":"signsgd via zeroth-order oracle,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.813019Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:89bfac624f24eecae36c9e90736224b30a574156c187c9b39c7168946a5dabc8","observation_id":"2c1a4bd9-e06e-4f37-83bc-626209b86c01","resolution":{"observed_at":"2026-08-03T12:03:26.813019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:26.956125Z","title":"Gradientless descent: High-dimensional zeroth-order optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.956125Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e2dc115b91fb3231821c987e505e3cd2b754a49924e98d6d38b8eaf5f3da71bf","observation_id":"bf3eeccb-650d-4691-a66f-711753fb82f1","resolution":{"observed_at":"2026-08-03T12:03:26.956125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:27.087220Z","title":"Simple random search of static linear policies is competitive for reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.087220Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:7fddd07f7a3cc94ec6fdac8ab18620b2151fbb52950e8d4c7e72429370070e5f","observation_id":"fd711158-2af0-4374-870b-0eebc6e45b89","resolution":{"observed_at":"2026-08-03T12:03:27.087220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.13345","last_updated":"2022-12-27T02:54:46Z","snapshot_observed_at":"2026-08-08T05:12:54.739479Z","submitted_at":"2022-12-27T02:54:46Z","title":"The Forward-Forward Algorithm: Some Preliminary Investigations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.13345","snapshot_observed_at":"2026-08-03T12:03:27.178394Z","title":"The forward-forward algorithm: Some preliminary in- vestigations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.178394Z"},"links":{"cited_paper":"/paper/2212.13345","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:0ea4db4553c645e296e796f80fb599e5ed1584ab0180b8a4d31edef9bcc56ef5","observation_id":"78c3204b-ec1a-456c-b6f8-1c50300a415e","resolution":{"observed_at":"2026-08-03T12:03:27.178394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:27.299542Z","title":"Variance-reduced zeroth-order methods for fine-tuning language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.299542Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:3b2fc98e0c416bba7d5c164c83ace081398ac9205c1e77050b8d18a729118044","observation_id":"e5e657a4-ca73-4f1b-9d9b-c5a804fac06c","resolution":{"observed_at":"2026-08-03T12:03:27.299542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:27.501623Z","title":"Revisiting zerothorder optimization for memory efficient llm fine-tuning: A benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.501623Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:22a2c7c9b9dec583831f73fa5d09bd93530b88e30f3d168114c55694881f28af","observation_id":"08ca4452-2714-4049-b2a3-e2d06e9623e9","resolution":{"observed_at":"2026-08-03T12:03:27.501623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:27.663867Z","title":"Zo-adamu optimizer: Adapting perturbation by the momentum and uncertainty in zeroth order optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.663867Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:cddff64d57aed0332c036113a540ca1d65445ec565bb4935912354926e0e847f","observation_id":"21f1afbd-021d-4acd-9e87-164fb2bfc519","resolution":{"observed_at":"2026-08-03T12:03:27.663867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08989","last_updated":"2025-07-24T16:21:10Z","snapshot_observed_at":"2026-07-06T19:31:57.906994Z","submitted_at":"2024-10-11T17:01:43Z","title":"Zeroth-Order Fine-Tuning of LLMs in Random Subspaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08989","snapshot_observed_at":"2026-08-03T12:03:27.808098Z","title":"Subzero: Random sub- space zeroth-order optimization for memory-efficient LLM fine-tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.808098Z"},"links":{"cited_paper":"/paper/2410.08989","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:1999d93645409c19a1a48a12e4d6216ee7b9234890d7a65f537c0115aff72066","observation_id":"0842c1f4-5674-48f7-a645-9ce510842efd","resolution":{"observed_at":"2026-08-03T12:03:27.808098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:27.967476Z","title":"Superglue: A stickier benchmark for generalpurpose language understanding systems,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:27.967476Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:237301aa8ac355accc9a60f481086a79d5b40285ce4c6a56a7b9e6d341b9a433","observation_id":"e133883c-4883-4340-bab8-39cb29b82e3e","resolution":{"observed_at":"2026-08-03T12:03:27.967476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.085186Z","title":"The commitment- bank: Investigating projection in naturally occurring discourse,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.085186Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:22c2d4b3e02ffba5541642c6337e7c7eec8f11321a303eebf13813e6d9f9d287","observation_id":"e12b8003-e3a4-4306-b519-4c0dc69d3975","resolution":{"observed_at":"2026-08-03T12:03:28.085186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.212167Z","title":"Choice of plausible alternatives: An evaluation of commonsense causal reasoning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.212167Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:c98b014aca1ad2f419c431195d015497b4944215af807aec69fdbdb8df794a49","observation_id":"c70c3bc6-6cbc-463c-aec7-769300cdce7e","resolution":{"observed_at":"2026-08-03T12:03:28.212167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.330678Z","title":"Looking beyond the surface: A challenge set for reading comprehen- sion over multiple sentences,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.330678Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:26d47200bcb0fcdcac425f272c78d204cc6d27db50728e97d6f17dffcc5b08f2","observation_id":"a4411d07-4e20-4756-a356-51829a3c6b1a","resolution":{"observed_at":"2026-08-03T12:03:28.330678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.508791Z","title":"Benchmarking applied seman- tic inference: The PASCAL recognising textual entailment challenges,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.508791Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:7b21f5e2510bee6d595172771a880f4625886851558a6a021df48afe0f87f0dd","observation_id":"1068c54f-0488-48f8-a79d-5cd31b668a87","resolution":{"observed_at":"2026-08-03T12:03:28.508791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.657093Z","title":"WiC: the word-in-context dataset for evaluating context-sensitive meaning representations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.657093Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:70eb044960b4b52ab9a193446709c4e04328c4e04261024974f87f44e9269608","observation_id":"a1118262-c3ff-4e62-8f2d-e61762201c6b","resolution":{"observed_at":"2026-08-03T12:03:28.657093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.799032Z","title":"The winograd schema challenge,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.799032Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:ae8b819a342c7c5229092e835093ed9c79e3a24330c9f48fdd446b2758003d1d","observation_id":"7322c0ac-dff2-4b8a-8767-3dbdae653b86","resolution":{"observed_at":"2026-08-03T12:03:28.799032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:28.928444Z","title":"BoolQ: Exploring the surprising difficulty of natural yes/no questions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:28.928444Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e5455bfaecfc927037e0af2c1de8c18600331f00d7d6722701d136bde919a22d","observation_id":"5e1bc26a-3874-4524-bcd1-656a9000f92d","resolution":{"observed_at":"2026-08-03T12:03:28.928444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12885","last_updated":"2018-10-30T17:32:16Z","snapshot_observed_at":"2026-08-06T02:57:51.203477Z","submitted_at":"2018-10-30T17:32:16Z","title":"ReCoRD: Bridging the Gap between Human and Machine Commonsense Reading Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12885","snapshot_observed_at":"2026-08-03T12:03:29.016881Z","title":"Record: Bridging the gap between human and machine commonsense reading comprehension,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.016881Z"},"links":{"cited_paper":"/paper/1810.12885","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:6ce055432738d7e38ac44f23a31f81674699c1c11f548a4a397e137da1106445","observation_id":"1c682244-44f9-4d3b-a008-32f97543207e","resolution":{"observed_at":"2026-08-03T12:03:29.016881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:29.140934Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.140934Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:f4191dffc596951a8188b551bc347f5ee7c879680966eaf97388d8e0666da112","observation_id":"8e045f2a-1459-4c21-9fe8-abec9ed32d0a","resolution":{"observed_at":"2026-08-03T12:03:29.140934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:29.269886Z","title":"SQuAD: 100,000+ questions for machine comprehension of text,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.269886Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:9e2402f4d75d5e7c65e4c13539d438a2c107d7a53d8001fd926af70f5becebd4","observation_id":"7ad5f1d5-d8c1-418c-ab9e-1bab2a9658c9","resolution":{"observed_at":"2026-08-03T12:03:29.269886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:29.402276Z","title":"DROP: A reading comprehension benchmark requiring discrete reason- ing over paragraphs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.402276Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:e6e26fc6a73fa064f24ab16168c843e92a5a55c79afa733caf9685c685839581","observation_id":"a3577886-fb09-4580-b28c-0a33eae32e67","resolution":{"observed_at":"2026-08-03T12:03:29.402276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T12:03:29.522036Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.522036Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:a3a0491d882624392b868ab7d1984c5d3c75d41193740847e7f31b2637e26762","observation_id":"6ad1b310-b187-4f8f-a30c-e12bbb12aedf","resolution":{"observed_at":"2026-08-03T12:03:29.522036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:29.730924Z","title":"Making pre-trained language models better few-shot learners,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.730924Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:0600fb1dd4f4e24aabde172b242e5ea3242349f3833e1a276ced66ce81343671","observation_id":"b586d719-a031-437b-b2da-b0a42280ea3a","resolution":{"observed_at":"2026-08-03T12:03:29.730924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:03:29.855120Z","title":"Exploiting cloze-questions for few-shot text classification and natural language inference,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:29.855120Z"},"links":{"citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:d69563fb11963d78755644ef6cc19d12b993a45ec8abb9ada4d6484696887f03","observation_id":"9e0f5b96-1ada-4443-a66c-f72a4f8501e0","resolution":{"observed_at":"2026-08-03T12:03:29.855120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:05:24.472901Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2601.04710."}