{"as_of":"2026-08-09T23:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0de552d33aa4c571ede0979f0574b54bb8e6c95a9fd806435ec3713852f4800","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:57:29.278658Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:10:49.683444Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:41:06.415113Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"cited_work":{"arxiv_id":"2506.01049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01049","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tam- ing llms by scaling learning rates with gradient grouping","venue":null,"work_id":"5ebd7558-1c13-46ea-9f13-769f09415621","year":2025},"citing_paper":{"arxiv_id":"2605.05794","last_updated":"2026-05-07T07:32:27Z","snapshot_observed_at":"2026-07-30T14:24:32.368109Z","submitted_at":"2026-05-07T07:32:27Z","title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:51.611115Z"},"links":{"cited_paper":"/paper/2506.01049","citing_paper":"/paper/2605.05794"},"observation_digest":"sha256:f458e712928cdf4c63a48b8f8eb1009b6e1e163be5f84397f2a0213efa5b48f4","observation_id":"39b37602-eb7a-4980-b4a0-f8e3a6ae7eb7","resolution":{"observed_at":"2026-05-11T16:41:06.419261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01049","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Taming llms by scaling learning rates with gradient grouping.arXiv preprint arXiv:2506.01049, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2506.01049","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:5277e4e07f4adbd50eecc3d6be53a93009c4f402887cdf24c1e299950e394107","observation_id":"b1e36740-728e-47b1-8590-2f2aeec73c55","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01049/citation-record","integrity":"/paper/2506.01049/integrity","json":"/paper/2506.01049/citation-record.json","paper":"/paper/2506.01049"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.960786Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.960786Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:76e642ffdd973fb997147a9a0a0246d86bb89ddb843d67a3cb5a848adefcba69","observation_id":"0963deb6-c74b-4b8c-80b6-ca00a44c6488","resolution":{"observed_at":"2026-08-07T11:57:28.960786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.965573Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.965573Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e7c63447966578966789082b48b0666783629bd6b68d72e3bc9e20760a0ff279","observation_id":"551f9183-6011-4774-a690-29566546a9c1","resolution":{"observed_at":"2026-08-07T11:57:28.965573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T11:57:28.969116Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.969116Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:6245df8f678e5315c2a5944cc76e05409d4734a3e581070803ec9315c007a7fd","observation_id":"b2f78582-7e3d-46ff-ad52-36f938fb7e84","resolution":{"observed_at":"2026-08-07T11:57:28.969116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17604","last_updated":"2025-08-19T19:14:56Z","snapshot_observed_at":"2026-07-06T18:20:52.408832Z","submitted_at":"2024-05-27T19:07:13Z","title":"LoRA-XS: Low-Rank Adaptation with Extremely Small Number of Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17604","snapshot_observed_at":"2026-08-07T11:57:28.972955Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.972955Z"},"links":{"cited_paper":"/paper/2405.17604","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:74a42776c14862dcea6ffc50e47356309fabf736a0c32647d1ebfc4fbc4f3bf8","observation_id":"0746c1e7-aa97-4e50-b269-2fbc6807cd5e","resolution":{"observed_at":"2026-08-07T11:57:28.972955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.976631Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.976631Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:a2e4db99f11e586a99fa857780f51b6cb8d5e7c922d21dd57a73568f8f4ae923","observation_id":"f31865e9-46bc-4f4e-83af-6ca0a2eb761f","resolution":{"observed_at":"2026-08-07T11:57:28.976631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.980071Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.980071Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:292bc20b68a6cb0d9535164941ff55c4bd6a7274c17d1aba2da8054cc6ba16ec","observation_id":"ff8d07a4-c54e-4f38-97eb-367bb43c0c7f","resolution":{"observed_at":"2026-08-07T11:57:28.980071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.983339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.983339Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:2746d88f0931474b484055885505918ad5c9f61717d2d5b17ae32cea88067868","observation_id":"52fac5ca-1489-47af-8830-ce9d1cc63cc6","resolution":{"observed_at":"2026-08-07T11:57:28.983339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16236","last_updated":"2025-07-03T06:59:56Z","snapshot_observed_at":"2026-08-04T14:59:50.724834Z","submitted_at":"2024-10-21T17:41:28Z","title":"LLaVA-KD: A Framework of Distilling Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16236","snapshot_observed_at":"2026-08-07T11:57:28.986563Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.986563Z"},"links":{"cited_paper":"/paper/2410.16236","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:245441eac81045de87d9bd6b034039f91598af9b0452ac489a0a0bd3a6c5bbd0","observation_id":"acd9c9c6-d16c-4306-a6d0-9b5881e8ea8c","resolution":{"observed_at":"2026-08-07T11:57:28.986563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.991360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.991360Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:9ab0321685adc6589188be904c601f22d70e17a47958778b777dd61c2baadea7","observation_id":"f2b3a661-29ae-442f-9be4-8049a765a487","resolution":{"observed_at":"2026-08-07T11:57:28.991360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.995330Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.995330Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:8510b00bff90162d34edc1151c6d6f0aad44165bc971d5ee205735a29cdc1a3c","observation_id":"ad7b1bb8-15bc-46ae-9929-e2f44bc0ca30","resolution":{"observed_at":"2026-08-07T11:57:28.995330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:28.998658Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:28.998658Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:07a12bb730ce47a81b6d618ab9765182fbde44272253a34711e19ff91946c5e2","observation_id":"3cd80351-bc8c-47b5-abf1-f6c9500b5ca5","resolution":{"observed_at":"2026-08-07T11:57:28.998658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.002055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.002055Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c3825e2f6c81203816612dff7a458d6937e0afb7d9607a68be5fb0090a5524c4","observation_id":"e68aeed3-1427-4dc0-bee3-9e33ee9beed7","resolution":{"observed_at":"2026-08-07T11:57:29.002055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T11:57:29.005938Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.005938Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:4e6b7cdbfe186d4b3ee1adcf24024ae5c6d94dac92097617a0c2c6c373c69f13","observation_id":"692be308-d7b0-470f-9cb0-d27506ec7c40","resolution":{"observed_at":"2026-08-07T11:57:29.005938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:57:29.010001Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.010001Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3f62d4d7e9405e811b1ea6e5ec2ee3b5cade027cb81032d2242251c9da4d2429","observation_id":"e73f06e3-5284-43c7-a3a7-e651d2fa2cef","resolution":{"observed_at":"2026-08-07T11:57:29.010001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T11:57:29.013438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.013438Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d9cf57e2f415549f73ee085623c1374b9087e4ba43f49c70bc8942d0b18b7680","observation_id":"4038c6b4-e5b0-41c2-acfa-ba023fc04a99","resolution":{"observed_at":"2026-08-07T11:57:29.013438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.016941Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.016941Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:de239a634c2c98aa5e28da0a53c52275a3a13b104be306a4791bedd6a7d3671d","observation_id":"9bc5028c-58e4-4e6e-b142-8b2c4c3e1e08","resolution":{"observed_at":"2026-08-07T11:57:29.016941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.020514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.020514Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:30f26d8a5765ba55ca8da365fdc97f04a2ba13419ea3ad9c339af3e2d1a84eea","observation_id":"3d09eed9-f3f1-4f1b-b336-868922556f8a","resolution":{"observed_at":"2026-08-07T11:57:29.020514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.024107Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.024107Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:e6a0944002b929e94883077ee0aafed243f9e8b5f7f1310fb4169ec96dae81b5","observation_id":"2b3ff932-08e5-4c17-91a2-f03696222cde","resolution":{"observed_at":"2026-08-07T11:57:29.024107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.027322Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.027322Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:29816dc2c998891376d057b9535e8b643a1df7c102d110c7ed39aa70cadbd032","observation_id":"82a835d2-ab35-4e35-8390-b26a6bc7eb62","resolution":{"observed_at":"2026-08-07T11:57:29.027322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.361040Z","title":null,"venue":null,"work_id":"9a4411ca-5a77-4ba0-9362-f3ccff1da173","year":2017},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.030485Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:24550f074e5025e10195d432b1b254bdf4e47f7cc5377027b6ddadbb92138f0e","observation_id":"971fbb92-8263-4497-9930-f1671856488c","resolution":{"observed_at":"2026-08-07T11:57:30.364643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.348997Z","title":null,"venue":null,"work_id":"1d980276-2501-430b-a35d-806c288a1e22","year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.033741Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:34a67626a8370db8663f8f30e2c441d6364c476f66bf2f3521d02662b18f5dab","observation_id":"c48c3115-6596-43e0-b15e-8798df9e7736","resolution":{"observed_at":"2026-08-07T11:57:30.352712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12354","last_updated":"2024-07-04T18:33:00Z","snapshot_observed_at":"2026-08-09T05:11:34.661398Z","submitted_at":"2024-02-19T18:33:49Z","title":"LoRA+: Efficient Low Rank Adaptation of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12354","snapshot_observed_at":"2026-08-07T11:57:29.037629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.037629Z"},"links":{"cited_paper":"/paper/2402.12354","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:576394c008a5eadcb4ea785a7c34edbf3c7d0ea4f8a3ae6633efce997e07c8d3","observation_id":"fd64ccbf-f79b-4857-82be-e64792012b92","resolution":{"observed_at":"2026-08-07T11:57:29.037629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.335742Z","title":null,"venue":null,"work_id":"e5acaebe-c0d5-4068-9328-f608a759e14c","year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.040979Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:6a7e5153bf826de436882292452f39aec1a1a2aca795d52ed87d3c6592264105","observation_id":"7292eecc-2457-4f45-a096-18a097d6434f","resolution":{"observed_at":"2026-08-07T11:57:30.339368Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.324553Z","title":null,"venue":null,"work_id":"0cea88ae-3d42-45a5-8761-a0692779e3a7","year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.044311Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:219e878894f207ea42727ef96bb812892ddc2f1ee8ddfafb305131cbf005ae74","observation_id":"165ad793-8fe0-459a-8b08-99fa783084ed","resolution":{"observed_at":"2026-08-07T11:57:30.328100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:57:29.047501Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.047501Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:dec443d2e4c0d1f4ae2fc5ca368aab7d8f745825b88cf7f2d90a54392e4d831e","observation_id":"d79f9994-2fba-40fe-89ff-79a511e26d96","resolution":{"observed_at":"2026-08-07T11:57:29.047501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-08-09T04:45:14.956800Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-08-07T11:57:29.051249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.051249Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:28174c70f694acfd65d1fb60f87127c30e8237446acedede606a95fa1e90cb9c","observation_id":"05cda9ed-9b95-4933-ad63-6ddbaff80b92","resolution":{"observed_at":"2026-08-07T11:57:29.051249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06842","last_updated":"2025-02-28T15:15:31Z","snapshot_observed_at":"2026-08-08T06:53:08.585360Z","submitted_at":"2025-01-12T15:21:22Z","title":"SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06842","snapshot_observed_at":"2026-08-07T11:57:29.054680Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.054680Z"},"links":{"cited_paper":"/paper/2501.06842","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:24ca61263964103192e0a26169355b32765a8d498f087d24c07f0ec5ae814ee9","observation_id":"9dd4f4fe-d38b-496a-ae49-bc58b853c8da","resolution":{"observed_at":"2026-08-07T11:57:29.054680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.058208Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.058208Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c78fc26d048b848ef0c100dda4f4e9793207c5f982994033cab356769b783839","observation_id":"331539f7-7b6a-463e-93b9-846c81e04baf","resolution":{"observed_at":"2026-08-07T11:57:29.058208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-07T03:29:16.217842Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-07T11:57:29.061428Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.061428Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:00b68c4add307ecf0dac4937c50e6ea7b13bb43b2f36d63152819325ec34b2af","observation_id":"cbab1350-ed83-40e4-9c6d-b1b7bb62ffb6","resolution":{"observed_at":"2026-08-07T11:57:29.061428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.304269Z","title":null,"venue":null,"work_id":"0ef1bb75-7836-4631-9567-d55b108ec83a","year":1994},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.064748Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:4906716e52f9760e884a960d4a47ad176570e7fec8cb42bcb515adf2ce18050c","observation_id":"0f00894e-3412-4e42-903f-4742cd1e9907","resolution":{"observed_at":"2026-08-07T11:57:30.307740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.293031Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"69a15207-86a8-4971-9579-ca8293de9319","year":2015},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.067938Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:ac26dc5883571cfd86d24c8288f5eb94403edb736bea273daadc9dae1f9d5a1e","observation_id":"c83b9a68-badd-459f-8bb2-6f2024d8bbd8","resolution":{"observed_at":"2026-08-07T11:57:30.296503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.281750Z","title":"o pf, Yannic Kilcher, Dimitri Von R \\","venue":null,"work_id":"37024741-5d44-41be-a612-100b507c46b0","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.071052Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:19e5279fc8a41c0caccbe9f0a40ccf2892609d431a66607d06c3fe115ee33d74","observation_id":"ae32cc3f-32fa-495d-8410-ca4a74769a87","resolution":{"observed_at":"2026-08-07T11:57:30.285335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T11:57:29.074356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.074356Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:031c02bf1ae307d04d6862cdc80ff4fd03e513a0aa3a06589900fbc2c858c6a0","observation_id":"05593c1e-0953-4188-becd-72abe6222c2d","resolution":{"observed_at":"2026-08-07T11:57:29.074356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09695","last_updated":"2024-04-15T11:53:22Z","snapshot_observed_at":"2026-07-06T18:00:16.713949Z","submitted_at":"2024-04-15T11:53:22Z","title":"LoRAP: Transformer Sub-Layers Deserve Differentiated Structured Compression for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09695","snapshot_observed_at":"2026-08-07T11:57:29.078239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.078239Z"},"links":{"cited_paper":"/paper/2404.09695","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:51b7b321435d12eefb16c4eea86f516216530f9e30f1364449509ac341791a2d","observation_id":"109676e1-f73c-4df9-a5d3-778c96f7cd5f","resolution":{"observed_at":"2026-08-07T11:57:29.078239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.081480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.081480Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:fd62eb51ba4b3003e99a9c2432a6821f8ec670f3724bc1cfcc1719253eefee89","observation_id":"10c826ac-215f-4559-8d2c-002b3bdd6f5a","resolution":{"observed_at":"2026-08-07T11:57:29.081480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14578","last_updated":"2024-10-28T04:10:40Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:52:36Z","title":"Surge Phenomenon in Optimal Learning Rate and Batch Size Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14578","snapshot_observed_at":"2026-08-07T11:57:29.084798Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.084798Z"},"links":{"cited_paper":"/paper/2405.14578","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:9d9967f8a836cb0fef4a100e7ec9d517c70956ca846334e73b8e1d155be1661b","observation_id":"84c01ecb-d986-44d9-846c-1c85806a28e3","resolution":{"observed_at":"2026-08-07T11:57:29.084798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06373","last_updated":"2024-10-08T21:14:23Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T21:14:23Z","title":"Unveiling the Backbone-Optimizer Coupling Bias in Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06373","snapshot_observed_at":"2026-08-07T11:57:29.088289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.088289Z"},"links":{"cited_paper":"/paper/2410.06373","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f10fdc81eb788023d5fa3b3007441a682a7189199cd20febb5d0b056e88fe13a","observation_id":"88980bb8-475c-4efc-8aa0-b0dffb53b9f5","resolution":{"observed_at":"2026-08-07T11:57:29.088289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.261167Z","title":null,"venue":null,"work_id":"0a12b680-217f-4d0b-93f2-2b3db344e0a5","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.091805Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:2d3a46c34a496c986ef2371485207d9658f051ee6279127b3ecf8dd0e8a71f76","observation_id":"364bbec4-e582-4037-b2b8-ce6cc5bc78cc","resolution":{"observed_at":"2026-08-07T11:57:30.264637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.248816Z","title":null,"venue":null,"work_id":"a1110009-ce1f-4986-842d-49769361bbf7","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.095039Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:deefdd15778c749a2b0e14d5a957591837e2ced24d7cfa2b6b40d41a1d7c35b4","observation_id":"7cdfcf04-d675-4a18-854c-468ef8462bf5","resolution":{"observed_at":"2026-08-07T11:57:30.252122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.236240Z","title":null,"venue":null,"work_id":"887047c0-37ed-4b3a-bf5b-f8d7ea08795b","year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.098283Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3b24aff27d7361a4d15ab530ef657e0f8f13e5a5e0cf977b6e7b5bed8342c8fd","observation_id":"dc732852-44aa-4a48-9b37-8a32aae9c42d","resolution":{"observed_at":"2026-08-07T11:57:30.239884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.224197Z","title":null,"venue":null,"work_id":"e5683aa4-5387-4f23-a26c-e77661a105a7","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.101419Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f8b773d6ab1f0156727f0e64271f696c7e31fc153fbcc7b3493af3cddf427576","observation_id":"f23a6cc7-1999-48cb-a9f3-eea0fd23118a","resolution":{"observed_at":"2026-08-07T11:57:30.228139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.212958Z","title":null,"venue":null,"work_id":"a668f051-fea4-4b05-b191-c839dcfc49cb","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.104867Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:6c1ef2969b8960e467fce203be819d49a3007e5876b6fa35dd65c19be23a4716","observation_id":"58996f95-d9c1-4333-a044-f7b8b12fb5d0","resolution":{"observed_at":"2026-08-07T11:57:30.216422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-07T11:57:29.108339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.108339Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:5179e4cf643e6c8363612ae76b764f01d1bd9972c671aee214f9751aa2a9a8a6","observation_id":"d965385b-4881-4497-a283-25194e44450c","resolution":{"observed_at":"2026-08-07T11:57:29.108339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.111921Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.111921Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:62f34dfa0f79b31512b99e690b589eeb12ba14609f1f4c3cfbcaf313365fbae5","observation_id":"f77f1f80-dc91-4ecc-b75a-d070ee67d29a","resolution":{"observed_at":"2026-08-07T11:57:29.111921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.115370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.115370Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:7ffe7bdcd201ccdad4a584a3270c0ec1be555e5beba29028ae7d34b7379ce3c9","observation_id":"f249484d-dc3b-4482-b5f3-a6ae44cf3c29","resolution":{"observed_at":"2026-08-07T11:57:29.115370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-07T11:57:29.118553Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.118553Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:27985919a71422afc5bad0792fb6c5166fdb0359891953fd2bc6a120c8230cd7","observation_id":"01d72d3a-a244-4dcc-9acc-ac26c3dc937d","resolution":{"observed_at":"2026-08-07T11:57:29.118553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.184958Z","title":null,"venue":null,"work_id":"933ab08d-b7ed-472a-9090-f640f337af27","year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.122075Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:1abc5b67ae27018311fa715ab5b128f43c236e0ce297e2a16c39b702cdddbcc1","observation_id":"c88cdf3a-b3a5-47fd-9c7a-756791a6b415","resolution":{"observed_at":"2026-08-07T11:57:30.188577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.173245Z","title":null,"venue":null,"work_id":"7ccedee9-f729-4134-acc0-8f8797e094a1","year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.125346Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d92b56c0bcc1aa86a09c5ea166c249c85b70a4532c164691cca0d17d162175b8","observation_id":"bd877286-b983-49ef-a3a1-6eeba05ac596","resolution":{"observed_at":"2026-08-07T11:57:30.176770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-07T11:57:29.129514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.129514Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c955a34d0e7e56e1a067607858c2c8c1d5c57973f049247aa95e4aa54ad725af","observation_id":"60d1ffe9-8272-4615-84eb-d64e913ea568","resolution":{"observed_at":"2026-08-07T11:57:29.129514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.161488Z","title":null,"venue":null,"work_id":"39db9135-16ef-4e05-a5fd-75498f9f6937","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.132995Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:b0625f5afe7c384dac6083861e23c2c133929ec78e1757b14889ca4eecb0fa7c","observation_id":"cc653f9c-4569-4eb6-86cf-d8074085a207","resolution":{"observed_at":"2026-08-07T11:57:30.164748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.149788Z","title":null,"venue":null,"work_id":"a42f5aaf-01f8-4901-9a47-533753ab4d4f","year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.136203Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:1f2b4227ad1c753d06d878691eec9fb1410440025834ebad36adbe607b32de71","observation_id":"e9786330-16e2-47b7-8b01-43fb2e0337be","resolution":{"observed_at":"2026-08-07T11:57:30.153328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.138102Z","title":null,"venue":null,"work_id":"504e8d85-b2c4-4856-a5d7-fffc169eb190","year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.139446Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:7609efab906b3a7fc2081b4c427dabc30229f54ea4edb1f51ba45ab4bed03635","observation_id":"476339c5-5912-4f3c-bb0e-e5fb722a7511","resolution":{"observed_at":"2026-08-07T11:57:30.141876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.125920Z","title":null,"venue":null,"work_id":"0382c636-3fde-4767-a0a5-5071c9e15d60","year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.142621Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:15d5df643a5723640e2d26a46eb03e01a50d0b6344ec03b7949cbe6a7c78e24d","observation_id":"b931a06c-dd32-4450-988e-2683564428c6","resolution":{"observed_at":"2026-08-07T11:57:30.129665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.114680Z","title":null,"venue":null,"work_id":"a1bbbe76-f3e8-49bd-b7a4-9d64acda2671","year":2022},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.145820Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0bcc698eb998f4b327dfa5370968ce9202b07dee0607f434f7fcf7c46a474abc","observation_id":"16288887-825e-4553-aa28-8fd0e6c42175","resolution":{"observed_at":"2026-08-07T11:57:30.118083Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.103606Z","title":null,"venue":null,"work_id":"10e9172e-cfb9-4b17-8a1d-3a81f5b8c3cc","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.149567Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c76952ac773b4a0d1647b1766d4e24cac9bcb14f3b4e7bff309dbe6711481c0b","observation_id":"d1cd5d36-7d70-46d1-9dfc-ce586ea37d32","resolution":{"observed_at":"2026-08-07T11:57:30.107042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02047","last_updated":"2023-08-07T06:21:31Z","snapshot_observed_at":"2026-07-06T15:50:26.113234Z","submitted_at":"2023-07-05T06:05:36Z","title":"CAME: Confidence-guided Adaptive Memory Efficient Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02047","snapshot_observed_at":"2026-08-07T11:57:29.152833Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.152833Z"},"links":{"cited_paper":"/paper/2307.02047","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:8630635ae883d9c98f8a0aa3842c550f8bccc021a89289ae35b64e485cbaefc7","observation_id":"dfa9f3e3-acae-45c6-8047-415b0567a2ef","resolution":{"observed_at":"2026-08-07T11:57:29.152833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20339","last_updated":"2024-05-30T17:59:47Z","snapshot_observed_at":"2026-07-06T18:22:57.400982Z","submitted_at":"2024-05-30T17:59:47Z","title":"Visual Perception by Large Language Model's Weights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20339","snapshot_observed_at":"2026-08-07T11:57:29.156262Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.156262Z"},"links":{"cited_paper":"/paper/2405.20339","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:a443cad9233efef65eb8e40558b13f2c29d49d1fd1f1b873913334b3ff898512","observation_id":"28962728-0aa8-47cb-bd0e-ce6920dfe53a","resolution":{"observed_at":"2026-08-07T11:57:29.156262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.091680Z","title":null,"venue":null,"work_id":"51236cf4-5e27-49de-b072-5475c7927770","year":1967},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.159763Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:866b8ceab7e28e105e0a9afe8dce5339b183d78dc721d27bcaf4b43615e27737","observation_id":"897b4096-df09-470e-8495-9f998b50dd0e","resolution":{"observed_at":"2026-08-07T11:57:30.095539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T11:57:29.163047Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.163047Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:c21b0d15bb100eb3dcbe3ff8023c2959b94eac4c10411e1fa655fe38c5307dfe","observation_id":"3a9a2b64-3069-4a7c-ae52-e76ccfec22df","resolution":{"observed_at":"2026-08-07T11:57:29.163047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-07T11:57:29.166603Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.166603Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d2aa0501dbdeaa2c8093cac4884e603c02a443df546403381917cf047a966257","observation_id":"432c66dc-b5e1-4d55-91c0-e6a82faaa734","resolution":{"observed_at":"2026-08-07T11:57:29.166603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12067","last_updated":"2025-01-21T11:42:09Z","snapshot_observed_at":"2026-08-02T07:43:20.201763Z","submitted_at":"2025-01-21T11:42:09Z","title":"EDoRA: Efficient Weight-Decomposed Low-Rank Adaptation via Singular Value Decomposition","version":1},"cited_work":{"arxiv_id":"2501.12067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12067","snapshot_observed_at":"2026-08-07T11:57:29.511703Z","title":"EDoRA: Efficient Weight-Decomposed Low-Rank Adaptation via Singular Value Decomposition","venue":"cs.LG","work_id":"82bda866-70e4-45ec-88fd-9857c5bdab85","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.170521Z"},"links":{"cited_paper":"/paper/2501.12067","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:398b7d5f9e0fde00c304c046894f5319943db919376b70ae2e8809f06dfcc0d9","observation_id":"21b291a7-59a5-4f8b-8bc7-13a0211d6ec5","resolution":{"observed_at":"2026-08-07T11:57:29.517503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.079040Z","title":null,"venue":null,"work_id":"42ef8228-6257-4e60-b0ad-437c5261d890","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.174065Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:46f55520e58269d8894b9c4021e72b0b9397d4a5df50882e1c7c91475d2627bb","observation_id":"7c681ca2-5a6a-42e7-b647-7079d06871f0","resolution":{"observed_at":"2026-08-07T11:57:30.082626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.177371Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.177371Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:157e9c65030fd92f37666dc19c26851e974adaa880fef47545f90351aa4667f9","observation_id":"b89d3d72-25b6-4554-8823-3b457dc481da","resolution":{"observed_at":"2026-08-07T11:57:29.177371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.058513Z","title":"Reddi, Satyen Kale, and Surinder Kumar","venue":null,"work_id":"5a6abf41-035d-4cb5-b63f-194b36b10a8b","year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.180610Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:05f53430109ffc8076d783cfb0fda3c6be5cf590452d38e0ffb1c944cc290a76","observation_id":"63d0ecf8-4439-4f80-b8f9-a4d88e9b00a6","resolution":{"observed_at":"2026-08-07T11:57:30.062417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.183773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.183773Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:31fe0c135ed4b9a6fbff84db412218a858253e58a06b6f2e1eb83bf8cfa0ff80","observation_id":"89ed90fc-8074-4108-bc77-7327446f2e31","resolution":{"observed_at":"2026-08-07T11:57:29.183773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-07T11:57:29.187200Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.187200Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:7e52b910222c50f82b3bdd121fb88484771e1146967b3f206423b6d16927ebdf","observation_id":"10022d71-56be-4848-a29a-443a275c82c6","resolution":{"observed_at":"2026-08-07T11:57:29.187200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.038512Z","title":null,"venue":null,"work_id":"528574e8-95e5-4459-8603-44c17dc33fd6","year":2010},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.190488Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:1821a7ab02a543a6c16e083e15d65ca3140a01f20390f3bf1029ed62765e8f48","observation_id":"35116b00-3bc9-47c6-9fa4-a821ae2ae174","resolution":{"observed_at":"2026-08-07T11:57:30.041991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04235","last_updated":"2018-04-11T21:42:32Z","snapshot_observed_at":"2026-07-06T06:32:58.709094Z","submitted_at":"2018-04-11T21:42:32Z","title":"Adafactor: Adaptive Learning Rates with Sublinear Memory Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04235","snapshot_observed_at":"2026-08-07T11:57:29.193839Z","title":"Shazeer and Mitchell Stern","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.193839Z"},"links":{"cited_paper":"/paper/1804.04235","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:65e0181cd9eac55377497c39d6fd6c789935530e02b90097c39a8121d39989a6","observation_id":"2e966505-a288-4ba3-b062-3fa242178992","resolution":{"observed_at":"2026-08-07T11:57:29.193839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15881","last_updated":"2024-10-23T09:52:23Z","snapshot_observed_at":"2026-08-05T18:22:08.247118Z","submitted_at":"2024-08-28T15:52:23Z","title":"LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15881","snapshot_observed_at":"2026-08-07T11:57:29.197574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.197574Z"},"links":{"cited_paper":"/paper/2408.15881","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:9ffaa7971dfa008c49784f2fd627b34ced87bc3f9e284890e542194205eb606b","observation_id":"e5acd949-8072-4ba1-91a2-67b0f7a43217","resolution":{"observed_at":"2026-08-07T11:57:29.197574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.200848Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.200848Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:2c7b4d0a69ae27d11170255562df94875c34bad822cff9f3b6982b82e2deba89","observation_id":"e7cbdbc6-d00e-48ee-bb36-3159467da3d8","resolution":{"observed_at":"2026-08-07T11:57:29.200848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:30.018349Z","title":"Sinha and Michael P","venue":null,"work_id":"534ad3f2-fe43-442c-b9c0-81d2425eee57","year":1971},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.204136Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:5f64cdb4dd51442bfc05db80c778cb1e68d60eb3e2ea7f1bac5966f52a38bf6e","observation_id":"35eca4f5-bb6e-41e3-a6af-5695ac55c152","resolution":{"observed_at":"2026-08-07T11:57:30.021951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.207378Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.207378Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:425439811a3c533d0b7c2002e944756c00bb92ef73caf11654aee81d562fe0b2","observation_id":"05858b3f-1b4d-414c-91b4-fcfbaf86820a","resolution":{"observed_at":"2026-08-07T11:57:29.207378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.210678Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.210678Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:df6f792a23dbcdbd4bd6dfe09b3759eda34fcde2985febe42f37de4138c0a3ca","observation_id":"c41112a3-43f6-4036-b58a-eefa42ff0149","resolution":{"observed_at":"2026-08-07T11:57:29.210678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-07T11:57:29.214022Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.214022Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:0033d0e46a6cdcc25f95931a770d472ce8450fd7d89dddc2618a557d3e3aa453","observation_id":"93957090-2b1a-4fb8-b488-492be99e021e","resolution":{"observed_at":"2026-08-07T11:57:29.214022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T11:57:29.217387Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.217387Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:792dae9bf05df9d5bb7adca5934f16dcf3b5906852abccbce6ce8ffcbf9270b5","observation_id":"67f2c45a-9ca7-4b76-84dc-c6dcdb8ce9d1","resolution":{"observed_at":"2026-08-07T11:57:29.217387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.989679Z","title":null,"venue":null,"work_id":"42cb85a6-b7f0-4f41-8a80-cd24542cf9e4","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.220927Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:45de1bc657bd38227a9a108b1893b7f7daba693d1a20ee276a30715647f2b1fe","observation_id":"a56bb22a-4cd7-401b-a945-b401ac0a3a33","resolution":{"observed_at":"2026-08-07T11:57:29.992788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T11:57:29.224160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.224160Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d937ac7ec1e1e24d8559cdfefea3b0c59829721a072b08209bb430a2ef3dc31d","observation_id":"58806685-fab1-4a62-8eef-0b1953f973ce","resolution":{"observed_at":"2026-08-07T11:57:29.224160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.976742Z","title":null,"venue":null,"work_id":"45d4487c-042f-4272-bffd-358529fa3077","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.227542Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:559d8e4da8f87c6726875d251fa8173f7c1ce445121fe7d66cb8f8caba79c90b","observation_id":"27195656-a9b3-4348-bf49-d5c7179c9221","resolution":{"observed_at":"2026-08-07T11:57:29.980801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-07T11:57:29.230732Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.230732Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d579fda656f474fd54c1d11a9aaf9c9185f2faf38b313229056f101c9b406c89","observation_id":"40064f04-3bae-490b-bee2-4066438baa9a","resolution":{"observed_at":"2026-08-07T11:57:29.230732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.963567Z","title":null,"venue":null,"work_id":"07904a5f-7e4d-40a9-b633-7ee70331aed1","year":2020},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.233998Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bcd131a388cd1c412f4aab7f97fe65a79b98217467bc85aea94d4761901f3634","observation_id":"e0699f0b-c24d-4f2e-b5d5-575773268cff","resolution":{"observed_at":"2026-08-07T11:57:29.967560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.951759Z","title":null,"venue":null,"work_id":"b2b0a097-cda2-4435-8cd4-3253eb0f3107","year":2023},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.237565Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bd449be7d34f8a5b81a48d13eeeedfe727115258e66559a8a380982e6ee6aed1","observation_id":"488b4aeb-24ea-4312-9f2b-73aa3153362d","resolution":{"observed_at":"2026-08-07T11:57:29.955405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.939857Z","title":null,"venue":null,"work_id":"ec77c145-e443-43d7-af3a-9e0cbe988629","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.241519Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:4a3b13d066b3c46a308146e1604fc69a3107406525be8a4f455a51b95610fe84","observation_id":"29cfd7c2-10a0-46a8-859c-59632a011363","resolution":{"observed_at":"2026-08-07T11:57:29.943249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T11:57:29.245272Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.245272Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:869e910bc38be12b95bb31824a18350366e5a5d2251c62c7c584822664115afd","observation_id":"ca378888-4d58-4a7c-b368-cd91497d0e09","resolution":{"observed_at":"2026-08-07T11:57:29.245272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13787","last_updated":"2025-01-23T16:04:23Z","snapshot_observed_at":"2026-08-07T07:30:22.453328Z","submitted_at":"2025-01-23T16:04:23Z","title":"Parameter-Efficient Fine-Tuning for Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13787","snapshot_observed_at":"2026-08-07T11:57:29.248704Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.248704Z"},"links":{"cited_paper":"/paper/2501.13787","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:ffd491dcc6513ac9649d7541328ce89ea60cc8da10dacf580dae10d6ed62b5fe","observation_id":"9a396661-7194-4d09-9c32-792aaac1e40c","resolution":{"observed_at":"2026-08-07T11:57:29.248704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.928646Z","title":null,"venue":null,"work_id":"a811b79c-7882-4506-97c7-a03054c6cb18","year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.252216Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:8b07122a8340fc995d9ce2b652d525fe8ef37b7f8d3d3abe2d99111aaee2c960","observation_id":"210d5578-f9c6-4cd4-8a05-e7b376f11d57","resolution":{"observed_at":"2026-08-07T11:57:29.932025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-07T11:57:29.255600Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.255600Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:ee85f0d612b58d0bbe016dfdf1128fe7d9fbf94f3c8c88139a8e45eb7b3100eb","observation_id":"08551d6d-0321-4715-9421-bc9c26773f70","resolution":{"observed_at":"2026-08-07T11:57:29.255600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T11:57:29.259287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.259287Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:d7db0a9074032077edba9317b3efed1703ba4f26b7ff8b0c77add10eeb873b07","observation_id":"5d65b0bc-6e39-43ed-8c87-c595703282c0","resolution":{"observed_at":"2026-08-07T11:57:29.259287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-09T20:28:46.864757Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T11:57:29.263146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.263146Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:052a1bcab52ccd8c1ddd0aadf4109aacd6a64f5058c32c94deaef2018cf1443f","observation_id":"b19eaa3e-d997-4475-af1e-df2e6a124e0c","resolution":{"observed_at":"2026-08-07T11:57:29.263146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-03T05:27:32.394774Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-07T11:57:29.266772Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.266772Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:a77c764e0dd9a56f1392b47dd6ffef87af6e0cde5bec42db8aff34217f2d2261","observation_id":"fcc700fc-9253-4936-a883-bf2c1addffe4","resolution":{"observed_at":"2026-08-07T11:57:29.266772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-07T11:57:29.271257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.271257Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:f896d62f9be59ce70a085cbde4e6da4e1f4954872cee2d70c6f415634c09c76e","observation_id":"4ec620a7-60ca-46d6-8a67-437c76a0961b","resolution":{"observed_at":"2026-08-07T11:57:29.271257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10622","last_updated":"2025-06-14T08:10:48Z","snapshot_observed_at":"2026-08-07T22:20:27.338782Z","submitted_at":"2025-03-13T17:59:06Z","title":"Transformers without Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10622","snapshot_observed_at":"2026-08-07T11:57:29.274935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.274935Z"},"links":{"cited_paper":"/paper/2503.10622","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:3010bab315e40d31275d7d40ddfee0f79569cfa7fe4a17ad83e5fe6d0f5d44cc","observation_id":"b4fcc1d0-1de3-4fe9-9690-5d3932797f3c","resolution":{"observed_at":"2026-08-07T11:57:29.274935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:29.917267Z","title":null,"venue":null,"work_id":"737ac0e7-daf1-4f1c-9d38-47ef1f7fdf26","year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.278658Z"},"links":{"citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:5a399d7dd3fa4d6ad143620a416b5b50615b94fc221c572f7a6688c94fdc25b1","observation_id":"52272ecf-36fd-481c-87d1-ff47692244fe","resolution":{"observed_at":"2026-08-07T11:57:29.920689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 2 inbound Pith citation observations for arXiv:2506.01049."}