{"as_of":"2026-08-09T01:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eac117c88fa6480da97e3feca4296221abd9ca021c5c8afc65133450d7b2473a","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T16:03:20.699893Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07884/citation-record","integrity":"/paper/2607.07884/integrity","json":"/paper/2607.07884/citation-record.json","paper":"/paper/2607.07884"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/0893-6080(89)90014-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural networks and principal component analysis: Learning from examples without local minima.Neural Networks, 2(1):53–58","venue":"Neural Networks","work_id":"c3d48c07-17fe-409c-9b44-cfb9d94cfee1","year":1989},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f3efed7e39553aa0df55b9a560aac7b01a105e6f1c832f17b46fe9939c6b2d69","observation_id":"8a687248-9d56-477f-9000-e36bf26ed1e4","resolution":{"observed_at":"2026-07-10T16:07:20.252525Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.561380Z","title":"Gen , volume=","venue":null,"work_id":"44b5c4ce-c8f4-41b6-926b-150f302be29a","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:b1a4a8240e47f9892d57d0f12e132bc693e7fe7945a03f01fa5d689f1d9b9f61","observation_id":"cd8e9f22-3e4a-41a6-b4d8-2973b66b3033","resolution":{"observed_at":"2026-07-10T16:07:20.562939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.563802Z","title":"Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"7e32ea88-9983-4802-93c6-6136c9ad4763","year":2010},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:4dc328060822dc87e2832043cfe70ca1ac966b28e314d3a6710e062e818dead2","observation_id":"da70ab83-7e20-47ce-87a7-ba88138088a3","resolution":{"observed_at":"2026-07-10T16:07:20.565366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.646069Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"386c8744-2608-498c-b4c5-ccb1e6f02a5b","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:500635ed1e15e3a199f8e92014800d2277fc5e79e5d10e69af9b8a0519dfc623","observation_id":"4cabddbe-cf2d-404f-8b71-030109a7906b","resolution":{"observed_at":"2026-07-10T16:07:20.648305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.631879Z","title":"Exponential expressivity in deep neural networks through transient chaos , url =","venue":null,"work_id":"1e5a931f-5cd7-4864-b531-43f646b5a6e0","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:fcefa7ee367ac5dcefbd1dfc5205b6a03b9f9d1f68f7d71739379c84a1ad4267","observation_id":"a55e118c-4e7c-489e-9e67-ca0ce54ca940","resolution":{"observed_at":"2026-07-10T16:07:20.633775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.573063Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"da67fc4b-572a-491d-b1d6-b97ce09f4eec","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f6f9820e1a52238ea6664693d1cb88ccd62f2ef723b66ee3df7ba1849f5d19f4","observation_id":"3023b154-5238-488e-9399-925e4cb6a0c7","resolution":{"observed_at":"2026-07-10T16:07:20.574459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.614105Z","title":"Zico Kolter , booktitle =","venue":null,"work_id":"14977275-e02d-4037-9083-388ead9ea60d","year":2017},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:1c4ff3cd3b316d63c4357b0da6928a484c2404ef24dc518dd42ff2df74cff932","observation_id":"930da198-b5d1-4d9a-ba3d-1e1d45a8b20b","resolution":{"observed_at":"2026-07-10T16:07:20.615801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1088/1361-6420/aa9a90","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable architectures for deep neural networks","venue":"Inverse Problems","work_id":"4f0eab7a-e426-4871-b927-627ffbff3ff6","year":2017},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:ceec4b193baed37b0d69f6afe8d8a62a3ed285eddce16e299fcfbc11a112573c","observation_id":"f1a9f19c-89ea-47ae-a274-c3d03a3be811","resolution":{"observed_at":"2026-07-10T16:07:20.254811Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-25T08:25:54.554828+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T08:25:54.554828+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.552409Z","title":null,"venue":null,"work_id":"f04ee972-7a96-47d8-8656-b4c48f31b828","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:906133d6b5aca3e8d3115ba701264baeade8e63a31990755950e1e38983825a1","observation_id":"d701b219-cb76-4ed4-b3e3-de792b432e17","resolution":{"observed_at":"2026-07-10T16:07:20.554030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.634540Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"60605810-8973-4cf8-adca-ca0b86a70b5e","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:0ad2b5bd5b5bb6dc786e4f7aac56c243513ab6cfa100bf0777a4a1b5b45623e3","observation_id":"368a6c83-d58d-40e4-92e6-45324465ea90","resolution":{"observed_at":"2026-07-10T16:07:20.636631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.575171Z","title":"Dynamical Isometry and a Mean Field Theory of","venue":null,"work_id":"57f619af-a47f-4c96-b382-db61228316c3","year":2018},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:ca8f8a6ebcf0541ba49721000512c90309cdd6ab073c0a15d65d7d98fbf89dde","observation_id":"215594c1-c043-4858-a838-839edcf6f5e8","resolution":{"observed_at":"2026-07-10T16:07:20.576754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.577579Z","title":"Zico and Koltun, Vladlen , booktitle =","venue":null,"work_id":"3a77dabb-fbf7-4993-809d-d99d48c82e72","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:852cbd9ba737bf7b4bddecbd99edb0841c686b743b4e20396268cf0564789443","observation_id":"687a7327-11a1-4804-8bfb-5b65337e3963","resolution":{"observed_at":"2026-07-10T16:07:20.578822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.637707Z","title":"Mathematics , VOLUME =","venue":null,"work_id":"1e28e033-af86-46bf-a3a3-6606e3b36447","year":2019},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f0aa14273991b987c9f23d7031f44e6302d347c3de72a601a322013480534be5","observation_id":"caf47eda-729a-4b56-a7bb-5bf20b8402a5","resolution":{"observed_at":"2026-07-10T16:07:20.639508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.596057Z","title":"Saxe and James L","venue":null,"work_id":"52ed32f4-77a5-4ddd-9060-9f1b35b74649","year":2019},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:4a3a9a8498494276bb8590fd337f3f1f54eccf0159b3ebe79c2ead4d74ef6ee1","observation_id":"5364c6ae-9596-4256-a392-cbd56ab974b0","resolution":{"observed_at":"2026-07-10T16:07:20.597830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.621299Z","title":"Proceedings of the Thirty-Second Conference on Learning Theory , pages =","venue":null,"work_id":"c3b5c3a7-152e-4049-8d99-2484194a386b","year":2019},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c42237aec76db4f974e02ccd19893bd2fda7e344cb1320c829a1c93454b1a0a1","observation_id":"542b995e-ea7c-4f8a-9e8c-f410dc5b14bb","resolution":{"observed_at":"2026-07-10T16:07:20.623306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.594933Z","title":"Implicit Regularization of Discrete Gradient Dynamics in Linear Neural Networks , url =","venue":null,"work_id":"6612507d-7742-4e71-91e9-a8d42be62d02","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3c1cb5306c4b2ac045c9b8aebeba8cd1cdca913614bd276e54d3d04841e57bb0","observation_id":"5d1c52f6-8eaf-4568-a70e-bcd096aa43cb","resolution":{"observed_at":"2026-07-10T16:07:20.596450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.633978Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"e65246c1-b293-458a-ac68-c07f7893034e","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:2ed09cf72080376dae55b6ba326d49b6ce68722cd0852dccb8774274aa99d4bb","observation_id":"62db237f-7d76-4f55-9e29-45aa6fe2f193","resolution":{"observed_at":"2026-07-10T16:07:20.635414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.631204Z","title":"2020 , eprint=","venue":null,"work_id":"097441f1-67a5-4255-b088-89b8224d151c","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:14e2a6704b538a0be7e47ecaa5a3116e26e0853b79452681222b7d872f3eab0e","observation_id":"0f7e6eb4-8e16-4465-b038-60675834985f","resolution":{"observed_at":"2026-07-10T16:07:20.632623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.649261Z","title":"An empirical analysis of compute-optimal large language model training , url =","venue":null,"work_id":"09d026a9-9833-4cc6-8558-d51fe90a7e3d","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:937a4f0d5bd643e688baec898f874d3c4abc8c02e1214fe4665849254e445466","observation_id":"2c768d4c-b83b-4417-a873-a3eb4d611d19","resolution":{"observed_at":"2026-07-10T16:07:20.651059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2020.08.022","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advani and Andrew M","venue":"Neural Networks","work_id":"8ff02d40-4bb8-444f-87e9-45087dd5d7d7","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:9b4cfd844e5273a8c13b5e13b2bb93f8c808db2961d68faefc4026c5a6550371","observation_id":"0808331a-0776-4776-b6c9-4c6bb6f3d52e","resolution":{"observed_at":"2026-07-10T16:07:20.258992Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-06T20:38:20.29822+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-06T20:38:20.29822+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.623689Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":"0371f2c1-e8cc-4bd7-ba2b-1cd52e1b91e3","year":2021},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:79e9be444713d924fb05dbdcbdd193c2fec5697f640510ebf073764ea3febc40","observation_id":"cdb7c0e7-f654-4cc6-9b6b-0e2940bf317a","resolution":{"observed_at":"2026-07-10T16:07:20.625378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.616135Z","title":"Exact learning dynamics of deep linear networks with prior knowledge , url =","venue":null,"work_id":"98f42055-29fc-4864-a6b2-cbf5262b5c1a","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c939f87bf630946a7b868716b028faf52d4db1bf5f2caace4025dd09afd34044","observation_id":"118a5d4a-ad92-4b95-bb86-2f29327de38e","resolution":{"observed_at":"2026-07-10T16:07:20.617816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.646312Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"0d19ef44-e6ab-4c32-a714-4b5a08e2b9a7","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3a09e6cbc5e344d9806b93fd4cea2ebb13f431aaedd83af89598eb5d42a2cf4c","observation_id":"c78c5037-e4ee-49f4-915d-11f55c8e7f59","resolution":{"observed_at":"2026-07-10T16:07:20.648494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.561847Z","title":"Proceedings of the 35th International Conference on Machine Learning , pages =","venue":null,"work_id":"53adbc40-77f6-471d-9ac1-bdc7520dad6c","year":2018},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:2fe6217c6635f832e586a55c73c90f30e59dee8bfa6dbd1897efd064a4042d9d","observation_id":"bbd5238b-a552-47a0-aa00-e406fd7b7fa7","resolution":{"observed_at":"2026-07-10T16:07:20.563279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.566528Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"01d57ee5-3a37-40b6-82c3-a09fa3aa4a49","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:822d75f33346036f28cb99e63ba016a8a674296f534f41ccfa8d7e80bfb41c8d","observation_id":"1770b131-9be9-4037-8c7f-184194bf71b3","resolution":{"observed_at":"2026-07-10T16:07:20.567880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.643635Z","title":"Algorithmic Regularization in Learning Deep Homogeneous Models: Layers are Automatically Balanced , url =","venue":null,"work_id":"398a0f41-1431-4717-bec9-4ebd4b8a0068","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:bc93ca286624d4a7ce34069ad82a8f7a1e31448a8de1993b5147183a9c0c5dbb","observation_id":"9f6c0a02-482d-4969-90d5-70a52e8dfbd8","resolution":{"observed_at":"2026-07-10T16:07:20.645434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.621308Z","title":"Neural Tangent Kernel: Convergence and Generalization in Neural Networks , url =","venue":null,"work_id":"103f60ad-38fd-4542-94a3-ea4975706007","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a1db77de8cb1e4fe5a23ef1844baafda78b3731026efe88d9e5b44f7a30c8bea","observation_id":"630c31d4-2604-46c5-94c3-c55aaf8d83fc","resolution":{"observed_at":"2026-07-10T16:07:20.623055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.629091Z","title":"Learning dynamics of deep linear networks with multiple pathways , url =","venue":null,"work_id":"b31d6eb9-0c02-4ab3-8e15-b20d37896f62","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:5a8c0188e653616caae99a7115ee91d5ab799c52a219ef49df0a3fadf1df35d2","observation_id":"51dc76ee-d3e1-4251-866c-e713a86707a3","resolution":{"observed_at":"2026-07-10T16:07:20.630994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.624038Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"ed008717-2b67-463d-9292-ec46d027f1b0","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:cb51ba238cf7856933e002090ee7f2d84188e0076637014cd203b184974276f1","observation_id":"f2cefb4a-00a7-4c9b-aeef-3e75caf8eaeb","resolution":{"observed_at":"2026-07-10T16:07:20.625746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.591732Z","title":"On Lazy Training in Differentiable Programming , url =","venue":null,"work_id":"e2df7ff0-7e2e-41af-8abb-b3d9ce18fd72","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:02fed6beb180ad3664d69411891b4c1cc3c122f4f62f12d9c5a5b1bc39fb7465","observation_id":"dab66938-3f60-44a3-980b-ea98c1c28db6","resolution":{"observed_at":"2026-07-10T16:07:20.593037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.570854Z","title":"Proceedings of Thirty Third Conference on Learning Theory , pages =","venue":null,"work_id":"5120c273-2023-49c4-b39d-e81bb86e5c66","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:b60f26bf5999fac5acaddfb1d514385ffb5f6145a56f2e253a7cbead9b0dd41d","observation_id":"1c3d7d0b-8a43-4c0e-8dff-0344efb8a3d6","resolution":{"observed_at":"2026-07-10T16:07:20.572433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.586737Z","title":"Proceedings of the 37th International Conference on Machine Learning , pages =","venue":null,"work_id":"2e9e7459-5b7b-4dbd-bd01-3c2604634d28","year":2020},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:225a90a9b259760a1f0444a49d8c647a864cea92c67ee0b9dd600d02b7bd0d12","observation_id":"4c3c4fcd-d375-4153-9275-14ce1849f4c7","resolution":{"observed_at":"2026-07-10T16:07:20.588362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15933","last_updated":"2022-01-31T12:58:39Z","snapshot_observed_at":"2026-08-08T08:13:53.762544Z","submitted_at":"2021-06-30T09:34:05Z","title":"Saddle-to-Saddle Dynamics in Deep Linear Networks: Small Initialization Training, Symmetry, and Sparsity","version":2},"cited_work":{"arxiv_id":"2106.15933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.15933","snapshot_observed_at":"2026-07-10T16:07:20.384070Z","title":"arXiv preprint arXiv:2106.15933 , year=","venue":"stat.ML","work_id":"755f4229-8616-4db7-ac4d-8b52abc3b055","year":2021},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"cited_paper":"/paper/2106.15933","citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:e1cbce15fabc05be61d8d6cb831fda0ea2396d707ba7d1367ee9f8595049fd81","observation_id":"30a82447-6799-47ae-b1a5-dddadb43daf8","resolution":{"observed_at":"2026-07-10T16:07:20.385724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.643213Z","title":"The Shaped Transformer: Attention Models in the Infinite Depth-and-Width Limit , url =","venue":null,"work_id":"8de67503-7471-409f-9f47-a19f1572a72a","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3b570e92e7f199a7299debabbf8afc902a192cde1af7087d1bcdb18d0125837d","observation_id":"4a64eb52-b03e-4b8a-9c94-e9858b371e5f","resolution":{"observed_at":"2026-07-10T16:07:20.645229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.625990Z","title":"Journal of Machine Learning Research , year =","venue":null,"work_id":"c1fe8f73-4023-4c17-8a49-abbb46bd11f4","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c6c659e44ce04e22ab8a48aae98bb519e36dc3339fcafa082abce7078e71fd9f","observation_id":"c8af1a34-01bf-4dca-b7fd-1f047e3c2486","resolution":{"observed_at":"2026-07-10T16:07:20.627302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.599631Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":"b5211402-defc-4242-9560-225750afe796","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:4b3a8aca77a97975033f105f9c9f92e4e6d697c1b3845b2c3b0af38852438d38","observation_id":"80506e23-a505-4263-b3f2-3156c69913d3","resolution":{"observed_at":"2026-07-10T16:07:20.601147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.598450Z","title":"Saddle-to-Saddle Dynamics in Diagonal Linear Networks , url =","venue":null,"work_id":"11b31670-95fe-4746-8fe8-283627c0f521","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:ffd1299ac57723372bdd2cfa130515bb96eed312b3afd4c7769d57ed75f02b2e","observation_id":"24837d75-761d-4b7a-aa8e-adf4ebe0b17a","resolution":{"observed_at":"2026-07-10T16:07:20.599906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.616550Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":"236073aa-6d1e-4c3e-a927-51a46982dfb5","year":2023},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:49485954a92a4de5b55779324e21e19ac6ac8057c91760acb9dc04ff413f57af","observation_id":"b2b9b646-b713-4f02-85f9-f1491fb2255c","resolution":{"observed_at":"2026-07-10T16:07:20.618117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.649080Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":"a2d5b891-a754-49a1-9095-a4d07c30ff85","year":2023},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:90241ddeb8dee302c6d6ab5145202d8a0b175af72468d078c230007e1347b794","observation_id":"cb90fa70-3ad6-45dc-905a-4937f474621d","resolution":{"observed_at":"2026-07-10T16:07:20.650648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.611920Z","title":"2023 , eprint=","venue":null,"work_id":"bf2a1cc2-229b-4126-82db-446f71e7dc22","year":2023},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:8e728df17983ddb07b66c4ad8511a8e3cd69b21a7cb24c5c1eb875450257ea14","observation_id":"04b7367e-3059-4e64-8e16-34d22b0b6b89","resolution":{"observed_at":"2026-07-10T16:07:20.613455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.546458Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":"aa7ee739-9981-41f5-8419-c4a9b98c12a9","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:0c85aaa9d4258b9bd49ce0b7ed300f4f953cc233225f927d77c5a84560b0d52b","observation_id":"44cbecbe-89e3-4a3e-a588-7c192c8a9c6f","resolution":{"observed_at":"2026-07-10T16:07:20.547835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.544230Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":"8f8236b8-5757-4691-b996-4384d88b25f1","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:d86469a0635a09a2c717295406544b3548dc17a40a2339cc49aace5871daf01d","observation_id":"854a339b-c844-483d-8450-4c90eb41986a","resolution":{"observed_at":"2026-07-10T16:07:20.545806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.609809Z","title":"Scaling ResNets in the Large-depth Regime , journal =","venue":null,"work_id":"0fb4d736-ef7c-485a-b66c-11e6bf6102ba","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:c723414629ea3413efe2336c0a7ec5f79168cfc63f8f3e56ff0dd38b6bfc728b","observation_id":"e5382b50-e944-481b-9f89-8e648a2537b3","resolution":{"observed_at":"2026-07-10T16:07:20.611211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-1130","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.52202/079017-1130","venue":null,"work_id":"d241881f-aad6-4b15-8717-55600c1d126b","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:d7c1ff4b860bc251ecb5e02116ceda23eb7db55131c6d53e8553bd6d9b682b4d","observation_id":"8be7c1d1-ac8c-43a6-b313-1d83b08f127e","resolution":{"observed_at":"2026-07-10T16:07:20.257203Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.628586Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"bcab77ba-394f-4f5d-ab8d-77abeab66951","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:f7461251f930b746a4c0e18375eced32875cc932e6fa439b48bd28087da6104c","observation_id":"bfada41c-7cc8-47ae-af52-c37df463f788","resolution":{"observed_at":"2026-07-10T16:07:20.629956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/079017-3262","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Super Consistency of Neural Network Landscapes and Learning Rate Transfer , url =","venue":null,"work_id":"30fd7520-9309-471d-9e15-65bb288ba69e","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:bd37081313e5b447c05aa527f76aad54ad3b3a41b7884952fd353aa74d77e5bf","observation_id":"0c2dcf6f-b129-4f30-bff3-be58607137a6","resolution":{"observed_at":"2026-07-10T16:07:20.249887Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.548548Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages =","venue":null,"work_id":"65945920-c075-4c04-98f7-1af7082ff69a","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:e595bace4f4734853b4aeb1f40d866329809f2cd113df267794b3c727aa18a3f","observation_id":"b6636d3b-b8b5-4da3-92b4-879f77d677eb","resolution":{"observed_at":"2026-07-10T16:07:20.550520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.651794Z","title":"Tensor Programs","venue":null,"work_id":"8004f5b3-1a97-4064-8fbc-19db4cb2b83e","year":2024},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:62e138f934c7984bdfcb947e1aedf39ae7706ca49d5d2974a04ca7aab974ec42","observation_id":"bb609da8-58b9-4e95-b3c1-f6fab75a7a34","resolution":{"observed_at":"2026-07-10T16:07:20.654152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.641464Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"1ca85f3c-2f06-46d1-93cc-499435e72cd5","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:31d3ca40453658dee88b7cd9094455f0d0f531a22573eef945deb74904ff5ff0","observation_id":"964467f7-6524-4f2d-bd4b-506086066732","resolution":{"observed_at":"2026-07-10T16:07:20.642918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.541776Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"c7391707-301f-44db-9985-34066a900d0c","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:ee60a44ddf3cce73567abde8ac395db391dd5294c110856506d9f58a55eb6b9e","observation_id":"625120dd-4aa9-4ff5-bb31-0b5ddab44eba","resolution":{"observed_at":"2026-07-10T16:07:20.543545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.589405Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"f2bf4b55-d183-4a37-83dc-19b7fa199665","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:664e120531578634f82ba17b559b431d42fc210f7054971d64926e0204152cff","observation_id":"bfeb656e-49dc-4958-ac4e-3d5d0ad6f6ec","resolution":{"observed_at":"2026-07-10T16:07:20.591135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.618474Z","title":"Proceedings of the 42nd International Conference on Machine Learning , pages =","venue":null,"work_id":"67e0a837-8bf6-4529-afe7-e5ab8187280b","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:3fe4a5cd14928bc4bfb7b36f0d951dfba06db112e0f65982810d5cd3b2febced","observation_id":"86c5296c-e948-4b2d-8ea9-14071eb25c66","resolution":{"observed_at":"2026-07-10T16:07:20.620548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.572789Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"51f112cb-03bd-4fef-ad23-66c66a578ed1","year":null},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:0321fcd6a7b03a1cec0160c52d3cf2cb23935f7a9a6a7296e7d8bf5ab72075c0","observation_id":"1cff7f7d-b18d-4d5d-93ee-c4d68a0c0e0c","resolution":{"observed_at":"2026-07-10T16:07:20.574296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.577429Z","title":"2025 , eprint=","venue":null,"work_id":"07b9ebeb-cb80-4699-8af9-cd886aeaeca9","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:a169b9a7ab852481c2eebc02528fb9fd2e1be286992ab0eca39569b16ad8b2c7","observation_id":"e8cd5fa3-3c66-4e92-9a32-0a27643bdc73","resolution":{"observed_at":"2026-07-10T16:07:20.579023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.640500Z","title":"2025 , eprint=","venue":null,"work_id":"66023e69-9bca-41fe-bc3e-552ecfe2a564","year":2025},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:506bb60ac8dd1586c3781b551b3f8eb6366859b716b71fab41223aa1abf33ac0","observation_id":"d08d0956-90bd-4334-accb-62310e375adf","resolution":{"observed_at":"2026-07-10T16:07:20.642388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.639006Z","title":"2026 , eprint=","venue":null,"work_id":"801bfbe1-112e-4792-9a49-81c9f0a5cb6e","year":2026},"citing_paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-10T16:03:20.699893Z"},"links":{"citing_paper":"/paper/2607.07884"},"observation_digest":"sha256:991ea1ce5188d56bf720624fe81d8f6410a5bf9919884837f7182d122fb7fb47","observation_id":"9f486c21-df81-4f6f-8993-cd06ac6ae73b","resolution":{"observed_at":"2026-07-10T16:07:20.640679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07884","last_updated":"2026-07-08T19:39:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T11:13:01.966646Z","submitted_at":"2026-07-08T19:39:11Z","title":"Optimal Learning Rate Scaling Depends on Data in Deep Scalar Linear Networks"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":4,"verified_fuzzy":49},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.07884."}