{"as_of":"2026-08-10T05:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d7649001b0a9697b377c93862b7f6b38e04af94a2e826cf792e595c3b60867c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":65,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:30:40.480336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":22,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:f52706fdfd235eb66f761add3ee1c81ac41baf6075fe5e67cb5966490a2d9a22","observation_id":"49ebe1bb-df9a-4815-97d4-dcafa6184419","resolution":{"observed_at":"2026-05-16T09:46:09.828773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T18:00:53.389420Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2404.06395"},"observation_digest":"sha256:4adfc8b70c0fd97385c605377a8c3dfea3c850996ac876dd5ae5cdba095e33c9","observation_id":"c444c54f-998f-4ff6-8b4f-73b341ea2453","resolution":{"observed_at":"2026-05-13T18:00:53.492235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-09T16:30:40.480336Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01146","last_updated":"2025-02-03T08:33:44Z","snapshot_observed_at":"2026-08-09T19:58:49.331330Z","submitted_at":"2025-02-03T08:33:44Z","title":"Quantum Machine Learning: A Hands-on Tutorial for Machine Learning Practitioners and Researchers","version":1},"reference_index":297,"source":"arxiv_source","source_observed_at":"2026-08-09T16:30:40.480336Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.01146"},"observation_digest":"sha256:c0daf48ed9e1c9cb87de2f57910437b96d7ab9729c9aaeb7ed6e45fff339e837","observation_id":"deffac94-4f6c-4eac-b5e7-54e88ba42668","resolution":{"observed_at":"2026-08-09T16:30:40.480336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-09T11:23:41.028667Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02732","last_updated":"2025-06-06T11:19:11Z","snapshot_observed_at":"2026-08-10T02:04:43.754736Z","submitted_at":"2025-02-04T21:29:47Z","title":"Peri-LN: Revisiting Normalization Layer in the Transformer Architecture","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T11:23:41.028667Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.02732"},"observation_digest":"sha256:e4a5fce036b5e3318de1c4761fd673f5849590b89f450cb340fb0411496a04bb","observation_id":"f5e1b34c-27a7-47fb-828b-3d361a3956a8","resolution":{"observed_at":"2026-08-09T11:23:41.028667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-08T22:55:57.885107Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04296","last_updated":"2025-02-06T18:38:26Z","snapshot_observed_at":"2026-08-09T02:35:32.610331Z","submitted_at":"2025-02-06T18:38:26Z","title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T22:55:57.885107Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.04296"},"observation_digest":"sha256:d4abe5c0fcebe132caafd721d7aa74b48a79e375606d2783cff4e301290447be","observation_id":"d732df23-9454-40e7-b4ec-9883a72a9547","resolution":{"observed_at":"2026-08-08T22:55:57.885107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-05-21T21:22:36.870292Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.07529"},"observation_digest":"sha256:e3ee41140f6c36858afe604fa86e44a34fdd51666d5eea0102b1c82b3e3f54b2","observation_id":"04e73110-0a67-4513-93e1-ad65f68f6e77","resolution":{"observed_at":"2026-05-21T21:22:37.131238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-08T11:19:07.043513Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07998","last_updated":"2025-09-10T18:21:17Z","snapshot_observed_at":"2026-08-08T11:09:21.022136Z","submitted_at":"2025-02-11T22:34:49Z","title":"Adaptive kernel predictors from feature-learning infinite limits of neural networks","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T11:19:07.043513Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2502.07998"},"observation_digest":"sha256:6f26ea8c739d4f5b5172d7495f1ab10278093e1730d1d2b1d13e8134c12ca09f","observation_id":"f0f72734-4604-44e2-8874-80dae20de07e","resolution":{"observed_at":"2026-08-08T11:19:07.043513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-07T15:19:28.124012Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15548","last_updated":"2026-07-28T05:39:01Z","snapshot_observed_at":"2026-08-10T01:36:17.402059Z","submitted_at":"2025-05-21T14:12:30Z","title":"Dense Local Dependencies Induce Attention-Logit Explosion and Training Instability During Long-Sequence Transformer Training","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:28.124012Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2505.15548"},"observation_digest":"sha256:ebd76c20efa6e699935bbccee7e98ade14b887a719d52f5f41961ea37840f156","observation_id":"fa20308c-6c33-4e18-b5bd-0f87e03f4ec8","resolution":{"observed_at":"2026-08-07T15:19:28.124012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-07T06:00:51.918076Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06280","last_updated":"2025-08-18T03:36:09Z","snapshot_observed_at":"2026-08-08T22:39:36.794739Z","submitted_at":"2025-06-06T17:59:28Z","title":"Eigenspectrum Analysis of Neural Networks without Aspect Ratio Bias","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T06:00:51.918076Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2506.06280"},"observation_digest":"sha256:855e7c05d0674b286eeaef6e5d3c40486c28775ecf30e4af4cae01e312dcb524","observation_id":"697b68ac-94da-4602-88c9-c39d7c8cf124","resolution":{"observed_at":"2026-08-07T06:00:51.918076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-07T05:34:24.066290Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07731","last_updated":"2025-06-09T13:15:50Z","snapshot_observed_at":"2026-08-09T00:45:01.971673Z","submitted_at":"2025-06-09T13:15:50Z","title":"NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:24.066290Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2506.07731"},"observation_digest":"sha256:000bbb0aa5433de994b1030c7625b8a0a2195980d61eb516e9906d05b3db09c5","observation_id":"52abb96c-b5eb-434a-a4a2-e9fb7259ebac","resolution":{"observed_at":"2026-08-07T05:34:24.066290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-07T05:31:22.209465Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07900","last_updated":"2025-09-04T16:23:02Z","snapshot_observed_at":"2026-08-09T02:25:55.181285Z","submitted_at":"2025-06-09T16:16:50Z","title":"MiniCPM4: Ultra-Efficient LLMs on End Devices","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:22.209465Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2506.07900"},"observation_digest":"sha256:6b389ffd6ac21ec67979ee29f038f183dd5f32cfe9d467b3e75652e06042146c","observation_id":"40a7be92-1fac-4728-bf5c-e254c7922771","resolution":{"observed_at":"2026-08-07T05:31:22.209465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T23:11:53.406334Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02907","last_updated":"2025-06-24T11:54:10Z","snapshot_observed_at":"2026-08-09T07:11:00.651868Z","submitted_at":"2025-06-24T11:54:10Z","title":"Scaling Transformers for Time Series Forecasting: Do Pretrained Large Models Outperform Small-Scale Alternatives?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:53.406334Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.02907"},"observation_digest":"sha256:f35e6ffb3f2a5b60da6d2e9b772a546f4291c1fd6a8da92e0d4f9184f40fdd20","observation_id":"72c0ebd4-46d4-481f-a0f6-93c6d391586c","resolution":{"observed_at":"2026-08-06T23:11:53.406334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T20:14:11.879402Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03526","last_updated":"2025-07-04T12:23:45Z","snapshot_observed_at":"2026-08-09T14:11:38.132882Z","submitted_at":"2025-07-04T12:23:45Z","title":"Decoupled Relative Learning Rate Schedules","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:14:11.879402Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.03526"},"observation_digest":"sha256:a8e05ae976a91e119df32602dd3ad485d990a74eace563f06f2f685c637ff178","observation_id":"9ce7b782-41b0-4714-80a4-1790ebce2626","resolution":{"observed_at":"2026-08-06T20:14:11.879402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T19:38:16.774558Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05566","last_updated":"2025-07-08T01:11:30Z","snapshot_observed_at":"2026-08-09T20:07:07.814930Z","submitted_at":"2025-07-08T01:11:30Z","title":"SingLoRA: Low Rank Adaptation Using a Single Matrix","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:16.774558Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.05566"},"observation_digest":"sha256:9a70b266c1f7f6dfcd7806e5a357623790786c828299fad8cf3b061f3d2ca62f","observation_id":"a9fd95c1-acac-4044-b814-f73f22274a83","resolution":{"observed_at":"2026-08-06T19:38:16.774558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T19:25:24.952647Z","title":"Tensor programs V: Tuning large neural networks via zero-shot hyperparameter transfer.arXiv preprint arXiv:2203.03466, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05966","last_updated":"2025-07-08T13:19:26Z","snapshot_observed_at":"2026-08-10T01:26:34.269871Z","submitted_at":"2025-07-08T13:19:26Z","title":"Simple Convergence Proof of Adam From a Sign-like Descent Perspective","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:24.952647Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.05966"},"observation_digest":"sha256:150c4772b4e6351088955fe9992fdf1667b8036b04087dee31dc43acbcd885c6","observation_id":"7c6d03a7-2de4-4203-a7a9-4740bcf55b6a","resolution":{"observed_at":"2026-08-06T19:25:24.952647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T18:44:32.764549Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08053","last_updated":"2025-07-15T08:40:16Z","snapshot_observed_at":"2026-08-09T23:29:13.988287Z","submitted_at":"2025-07-10T08:26:49Z","title":"Tree-Structured Parzen Estimator Can Solve Black-Box Combinatorial Optimization More Efficiently","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:32.764549Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.08053"},"observation_digest":"sha256:14a6d84eb29c89fd107a6a08eb29b69d149abd2e2da20e87f4281fa40ec65648","observation_id":"3427ea84-fa32-4cde-859f-82d61e64520b","resolution":{"observed_at":"2026-08-06T18:44:32.764549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T18:20:00.461750Z","title":"Tensor programs V : Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08771","last_updated":"2025-07-30T04:14:15Z","snapshot_observed_at":"2026-08-07T06:32:52.508610Z","submitted_at":"2025-07-11T17:28:56Z","title":"BlockFFN: Towards End-Side Acceleration-Friendly Mixture-of-Experts with Chunk-Level Activation Sparsity","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:20:00.461750Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.08771"},"observation_digest":"sha256:a3e575ce66f1543a12a8d42020e58bd3fcd28c684b3db9a59d49c0709ece566c","observation_id":"a97201bc-28ae-4c43-ab1a-f42024abd097","resolution":{"observed_at":"2026-08-06T18:20:00.461750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T17:56:44.138484Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-08T22:32:30.066463Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.138484Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:a23257fd39a9cd81c68e1d9f75bfd46c2ff60a9e6c58c5cbc6e6372b50a880f4","observation_id":"dc378ec0-4c39-468d-b6b5-76884dd7a08f","resolution":{"observed_at":"2026-08-06T17:56:44.138484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T16:53:15.816131Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-09T12:12:41.025897Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:15.816131Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:29551c66f2eb641995d6b3d4999187d9f7f85944e594616cf329b737cc9726e2","observation_id":"34726096-14df-4e98-91c6-80915f8efca6","resolution":{"observed_at":"2026-08-06T16:53:15.816131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T13:21:59.434212Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20853","last_updated":"2025-07-28T14:06:44Z","snapshot_observed_at":"2026-08-10T04:44:01.568944Z","submitted_at":"2025-07-28T14:06:44Z","title":"Geometry of Neural Reinforcement Learning in Continuous State and Action Spaces","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-08-06T13:21:59.434212Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.20853"},"observation_digest":"sha256:42b58c848cf68d2f01d49b1433361ed1bbae6ab94a43ca0615cc72f63fec1262","observation_id":"483f52a0-8dc1-42fe-bf33-4d97f6bd4c49","resolution":{"observed_at":"2026-08-06T13:21:59.434212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-06T11:44:05.207827Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-09T19:06:02.138099Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.207827Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:72620bef55505b72f420a3c8f2956dacf2ad503cfe766e13636a5eb113850d0b","observation_id":"0743b662-ab65-4238-a029-20da4a2bda73","resolution":{"observed_at":"2026-08-06T11:44:05.207827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T20:50:54.584556Z","title":"J.; Babuschkin, I.; Sidor, S.; Liu, X.; Farhi, D.; Ryder, N.; Pachocki, J.; Chen, W.; and Gao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.14087","last_updated":"2025-08-13T15:05:06Z","snapshot_observed_at":"2026-08-08T23:33:57.453280Z","submitted_at":"2025-08-13T15:05:06Z","title":"FM4NPP: A Scaling Foundation Model for Nuclear and Particle Physics","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:50:54.584556Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2508.14087"},"observation_digest":"sha256:e97a655812c5a58af1db422dbb2cbc18d86cc1fd35a6bb3ed2aef5b7603c0fc7","observation_id":"81b581f8-cae7-4270-9ef3-5eca51b731dd","resolution":{"observed_at":"2026-08-05T20:50:54.584556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-04T21:33:58.882869Z","title":"J., Babuschkin, I., Sidor, S., Liu, X., Farhi, D., Ryder, N., Pachocki, J., Chen, W., and Gao, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.07963","last_updated":"2026-06-02T19:48:10Z","snapshot_observed_at":"2026-08-06T19:53:55.837139Z","submitted_at":"2025-09-09T17:50:58Z","title":"Customizing the Inductive Biases of Softmax Attention using Structured Matrices","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T21:33:58.882869Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2509.07963"},"observation_digest":"sha256:9637b1b2864e3cf87094bd3a0bf06958ca0d9bcf74a0d27b078e4f376b8aa474","observation_id":"0af2bd64-eb77-4913-9748-358a415f6665","resolution":{"observed_at":"2026-08-04T21:33:58.882869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:b7ff0410261e73de64c2dfa2f2f7f9115090c56e4a5db9890862da7e4b0678ae","observation_id":"ab5518ee-fc94-4220-a46e-72af56d69016","resolution":{"observed_at":"2026-05-18T10:02:31.664367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-03T23:39:21.740885Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer.arXiv preprint arXiv:2203.03466, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.04981","last_updated":"2026-06-01T03:01:47Z","snapshot_observed_at":"2026-08-03T23:39:17.439120Z","submitted_at":"2025-11-07T04:56:45Z","title":"Scaling depth capacity via zero/one-layer model expansion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:21.740885Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2511.04981"},"observation_digest":"sha256:048f9d9e498a359dfa0184767e655a3e96c3fca6b2f1592a078a68b84a651157","observation_id":"fd660cdf-3628-46a6-b947-574615fd1ace","resolution":{"observed_at":"2026-08-03T23:39:21.740885Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2601.00417","last_updated":"2026-07-27T23:05:42Z","snapshot_observed_at":"2026-08-03T13:08:22.353654Z","submitted_at":"2026-01-01T18:11:38Z","title":"Deep Delta Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T17:46:54.521991Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2601.00417"},"observation_digest":"sha256:3216a2d87643077aae2c833a4dcfadb5d974b9b76f52c67b7cc2d72d489410ac","observation_id":"bb368725-c50d-45c7-8f62-05e13dca0e1a","resolution":{"observed_at":"2026-05-16T17:48:11.502720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-03T13:08:24.859118Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer.arXiv preprint arXiv:2203.03466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00417","last_updated":"2026-07-27T23:05:42Z","snapshot_observed_at":"2026-08-03T13:08:22.353654Z","submitted_at":"2026-01-01T18:11:38Z","title":"Deep Delta Learning","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T13:08:24.859118Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2601.00417"},"observation_digest":"sha256:58c13e2b5c256e66e29c4ef67343d6a490da19a93c2be9f0d339cb551e0d4b1e","observation_id":"f573360b-9b5b-4e98-adca-cbf73a1091b1","resolution":{"observed_at":"2026-08-03T13:08:24.859118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-03T05:27:12.183400Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.02472","last_updated":"2026-06-29T15:41:30Z","snapshot_observed_at":"2026-08-08T11:52:44.940982Z","submitted_at":"2026-02-02T18:52:52Z","title":"SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T05:27:12.183400Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2602.02472"},"observation_digest":"sha256:5c7c5e999c95ae31e957a27dd84782144a7005ca68c8507f55f1a22efd5e1ad8","observation_id":"8b000a58-37e8-4306-b5c5-7c2ae9ac8dca","resolution":{"observed_at":"2026-08-03T05:27:12.183400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-03T01:34:12.578849Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:93046d6bb9c7668f42e988ac435f6edaaafeeeaaabab11f821e89a875e5fcb68","observation_id":"3214c141-a4e9-4554-9b9e-31637c460081","resolution":{"observed_at":"2026-05-16T07:00:43.308266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2603.00541","last_updated":"2026-05-11T13:53:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-28T08:38:50Z","title":"Spectral Condition for $\\mu$P under Width-Depth Scaling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T18:03:31.202134Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2603.00541"},"observation_digest":"sha256:99369d2a0b3fd090e951dc10702c662bb1fdbff6429a240c384cd2b59fdbb8fd","observation_id":"67f86891-955d-4825-a120-c12d2d5ae5e3","resolution":{"observed_at":"2026-05-15T18:06:25.451488Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T21:51:14.678941Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2603.28743"},"observation_digest":"sha256:21f285aa401bebcd4d52ba65d8a898cef4bcc5fc4d67971da2ec49e7a665f9b7","observation_id":"d1182c22-33cd-4657-afeb-7823b8e9844c","resolution":{"observed_at":"2026-05-14T21:53:02.414734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2604.14198","last_updated":"2026-04-03T04:26:43Z","snapshot_observed_at":"2026-08-06T11:58:56.492844Z","submitted_at":"2026-04-03T04:26:43Z","title":"MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T20:07:29.544613Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2604.14198"},"observation_digest":"sha256:bd03e183fdbcf32f64bdeba26c9997a5dc37d2bed74d88583e7ef530eb93816e","observation_id":"e90e9a0c-317b-4ffb-b84e-5ab5945b74d3","resolution":{"observed_at":"2026-05-13T20:08:12.645597Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2604.21691","last_updated":"2026-04-23T13:58:12Z","snapshot_observed_at":"2026-08-02T12:48:50.592713Z","submitted_at":"2026-04-23T13:58:12Z","title":"There Will Be a Scientific Theory of Deep Learning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T20:11:17.616190Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2604.21691"},"observation_digest":"sha256:d6dbff63fbef55a7cd5bd2d49a20d1cb6654ccdc9b4eacd444e7469a3495143e","observation_id":"eecc8385-3b1a-4813-964e-1f18c989a4de","resolution":{"observed_at":"2026-05-11T15:21:08.817339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.05341","last_updated":"2026-05-06T18:11:14Z","snapshot_observed_at":"2026-08-05T16:58:55.662512Z","submitted_at":"2026-05-06T18:11:14Z","title":"Feature Starvation as Geometric Instability in Sparse Autoencoders","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T16:31:38.468164Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.05341"},"observation_digest":"sha256:a362dea32a280e752dd21a94bf890571cc27720cf21713f8e5092f58b15b3188","observation_id":"54776053-ae13-4975-8faf-474c8e3bcb47","resolution":{"observed_at":"2026-05-08T20:09:09.887485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.07815","last_updated":"2026-05-08T14:47:56Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:47:56Z","title":"OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T02:47:08.766380Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.07815"},"observation_digest":"sha256:1e2a17291e2bff431825bf723386fb4a424e9f7a111ee6ade3b763552c1bd123","observation_id":"74854a07-b373-4121-8df6-0403657081e1","resolution":{"observed_at":"2026-05-11T03:05:55.500915Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.07870","last_updated":"2026-05-21T16:56:03Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:28:01Z","title":"Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T03:02:52.833353Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.07870"},"observation_digest":"sha256:dabb9d8058fa25b6cc458843c657dd3fc3ba1ff67335fd8c5d7f38f20eab1038","observation_id":"b34976b3-b3b6-439e-bef8-05741a924671","resolution":{"observed_at":"2026-05-11T03:05:53.394859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.07870","last_updated":"2026-05-21T16:56:03Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:28:01Z","title":"Spectral Dynamics in Deep Networks: Feature Learning, Outlier Escape, and Learning Rate Transfer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T10:25:54.649302Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.07870"},"observation_digest":"sha256:98b24ac652280b56e305ecb36eebc20f87c3bb7d34f6d47cc54543809fda6995","observation_id":"72b3403e-7121-4245-9d98-d3e8d63d4b50","resolution":{"observed_at":"2026-05-22T10:26:24.110548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:19:12.696712Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:031ee56eb54fa7f16dcf8c587a5ffe7f793aa212b7c75f7ed1cb885a1b6f7a72","observation_id":"9f20b3bb-8813-4816-bbe7-768aa250bd67","resolution":{"observed_at":"2026-05-12T06:21:28.372242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.09165","last_updated":"2026-06-30T06:15:20Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:58:18Z","title":"Sparse Layers are Critical to Scaling Looped Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-01T07:26:37.559459Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.09165"},"observation_digest":"sha256:8d61852937a6742f4e069e60778f6eb5ce6f56417a1608aa892d143d7bb5e229","observation_id":"8e1563b3-a639-4f80-b3cb-96f1a24bc552","resolution":{"observed_at":"2026-07-01T07:35:29.134236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.09238","last_updated":"2026-05-10T00:39:13Z","snapshot_observed_at":"2026-08-02T15:17:04.657553Z","submitted_at":"2026-05-10T00:39:13Z","title":"Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:39.558349Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.09238"},"observation_digest":"sha256:c952272881c0cfa5f21fee7be99608f7108d36f287d9a94c5b641fd50a828b1c","observation_id":"223ee6e0-6e30-416c-bd99-f75729fde684","resolution":{"observed_at":"2026-05-12T05:36:26.119308Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.13225","last_updated":"2026-05-13T09:17:51Z","snapshot_observed_at":"2026-08-02T19:28:51.230887Z","submitted_at":"2026-05-13T09:17:51Z","title":"Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-14T20:17:26.661595Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.13225"},"observation_digest":"sha256:eb4870bb5d01ec1749ad6ca3fe837611168b011d132ba5c867aca8e0a661cd88","observation_id":"bbd3b439-e241-4331-b0e6-ac119083b36a","resolution":{"observed_at":"2026-05-14T20:19:27.406229Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:b9840f1baf151408bf4d07021e266115e62ed58e9fdffa5355a54c662316e56c","observation_id":"137d2869-5d3a-495f-be56-6ce14f851813","resolution":{"observed_at":"2026-05-15T04:49:44.699169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.15290","last_updated":"2026-05-14T18:03:16Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:03:16Z","title":"GQA-{\\mu}P: The maximal parameterization update for grouped query attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:40.231293Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.15290"},"observation_digest":"sha256:cf70c41b3d4c1c960253eacbb4824fbf1a30d174a42ace0aa02e0397ec89d527","observation_id":"ea5e42c0-568f-4e84-8ab1-52c434573633","resolution":{"observed_at":"2026-05-19T16:37:39.825511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.18797","last_updated":"2026-05-25T04:21:17Z","snapshot_observed_at":"2026-08-02T05:53:57.809613Z","submitted_at":"2026-05-11T07:21:53Z","title":"Simply Stabilizing the Loop via Fully Looped Transformer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:15:47.909334Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.18797"},"observation_digest":"sha256:e6563ffa45683e7d2e0870ed77c56447c7b739572a65a7f861ecf151362a9147","observation_id":"179ecece-900d-401e-86c9-a166afde2f41","resolution":{"observed_at":"2026-07-01T14:05:47.263372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.18807","last_updated":"2026-05-29T16:33:13Z","snapshot_observed_at":"2026-08-09T23:10:43.266999Z","submitted_at":"2026-05-11T22:41:03Z","title":"Block-Based Double Decoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T22:05:25.465669Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.18807"},"observation_digest":"sha256:6e70cafa2d00bf0cb90da8eeff6be1800f4b89b446834d95812bf34dbc5e4968","observation_id":"7a499c47-f64b-49f4-a754-0378549c499c","resolution":{"observed_at":"2026-05-20T22:09:07.439320Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.18807","last_updated":"2026-05-29T16:33:13Z","snapshot_observed_at":"2026-08-09T23:10:43.266999Z","submitted_at":"2026-05-11T22:41:03Z","title":"Block-Based Double Decoders","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T22:10:23.224012Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.18807"},"observation_digest":"sha256:99d21c512400e92ebb87f23f736a4d6fa3879d0313378e52bb1307f18d99f230","observation_id":"e40a3231-baa4-4812-8478-49d6dfdc0cdb","resolution":{"observed_at":"2026-07-01T14:15:47.113144Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.26248","last_updated":"2026-05-25T18:15:27Z","snapshot_observed_at":"2026-08-05T12:04:21.559242Z","submitted_at":"2026-05-25T18:15:27Z","title":"Unified Neural Scaling Laws","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:43.393302Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.26248"},"observation_digest":"sha256:1794ca48b3008495eed729362007cc051fdc501bd5290c1e6ece0ed9aad376dd","observation_id":"8c8492ca-96bf-428a-b8bd-ec0762b8846e","resolution":{"observed_at":"2026-06-29T23:44:03.344613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2605.26459","last_updated":"2026-05-26T02:16:17Z","snapshot_observed_at":"2026-08-08T13:14:56.355702Z","submitted_at":"2026-05-26T02:16:17Z","title":"MuCon: Clipped Muon Updates for LLM Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-29T19:56:47.120210Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.26459"},"observation_digest":"sha256:814420e558f8baf24ce5e69d9f48357b1a5e35656aa618e57b507d017bae2c3a","observation_id":"d0fdc726-c70c-4df4-9a57-e1a44dd9b2bc","resolution":{"observed_at":"2026-06-29T20:03:56.395584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-04T04:58:48.901353Z","title":"doi: 10.1088/2632-2153/adee76","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31244","last_updated":"2026-08-03T07:52:55Z","snapshot_observed_at":"2026-08-07T15:13:56.799192Z","submitted_at":"2026-05-29T12:43:51Z","title":"Spectral Reach: Understanding Neural Scaling as Progress into the Spectral Tail","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T04:58:48.901353Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2605.31244"},"observation_digest":"sha256:d27d0527755971bb7e5b4d3bfec840a8f99be2c71e01f8ec3bc73e208e04557a","observation_id":"f3b1de82-4626-42fd-9ac3-884dae64da54","resolution":{"observed_at":"2026-08-04T04:58:48.901353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.02437","last_updated":"2026-06-02T09:03:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T16:09:19Z","title":"On the Scaling of PEFT: Towards Million Personal Models of Trillion Parameters","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:32:19.456119Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.02437"},"observation_digest":"sha256:8bee531778578e797a5255bd63b46389c5307d9b0e668a4f80949d214ae77acf","observation_id":"de0c3d54-50eb-47db-8ec4-798875eb26da","resolution":{"observed_at":"2026-07-01T22:16:16.642255Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.04048","last_updated":"2026-06-02T08:45:24Z","snapshot_observed_at":"2026-08-02T14:08:10.277096Z","submitted_at":"2026-06-02T08:45:24Z","title":"Unlocking Feature Learning in Gated Delta Networks at Scale","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:18:55.669013Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.04048"},"observation_digest":"sha256:befe6820846528dd4bac9e757926d18e90d764a0336d79b9b86dcc19eb37b42e","observation_id":"7ae09695-3ace-4ddd-970f-0f69a7e1452b","resolution":{"observed_at":"2026-07-02T02:06:26.424178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.04058","last_updated":"2026-06-05T12:50:11Z","snapshot_observed_at":"2026-08-06T02:55:51.608023Z","submitted_at":"2026-06-02T11:31:21Z","title":"Spectral Scaling Laws of Muon","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:05.939340Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.04058"},"observation_digest":"sha256:a5f3e9bc832b35b494af74c7b1dd0881583527c2d088e3335c1dcefb579562e1","observation_id":"aee8d983-2224-4d30-94c8-a2bf7f7e5443","resolution":{"observed_at":"2026-07-02T02:06:26.383110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-02T08:47:15.917924Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:e8e0c0d513275d2e5c24a075e120f5aca3f0bc12fd9c779ac871ee4e219b095f","observation_id":"de8c3ed4-101f-4eba-bafc-97276805c1e0","resolution":{"observed_at":"2026-07-02T11:56:56.103926Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.18524","last_updated":"2026-06-16T22:39:13Z","snapshot_observed_at":"2026-07-06T23:53:59.519305Z","submitted_at":"2026-06-16T22:39:13Z","title":"On the Residual Scaling of Looped Transformers: Stability and Transferability","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T00:53:51.358774Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.18524"},"observation_digest":"sha256:0f35ec1d2986968aaae7be535b26c5efa888a4f17cef08ea803cd0e2438cb020","observation_id":"344187bf-160c-4d78-a7e9-d048c05d745f","resolution":{"observed_at":"2026-07-03T21:08:58.378584Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.24901","last_updated":"2026-06-12T13:44:48Z","snapshot_observed_at":"2026-08-03T03:21:51.293576Z","submitted_at":"2026-06-12T13:44:48Z","title":"LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-06-27T05:02:18.347642Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.24901"},"observation_digest":"sha256:5c2cf5d8b1ee4e209b5cc27c358900b14512e7adb32856bfca006d82fcb2b901","observation_id":"14a3a96b-c447-4fd7-b4ff-5620e21c9628","resolution":{"observed_at":"2026-07-03T16:48:39.965275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-06-25T20:05:09.179627Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:28a94223cd34e9d7d7e727d9adbbb1577f142e4c1db998cc689e127851f00f83","observation_id":"ad024d55-dee2-4067-9e3c-0b8a1ac4c6bd","resolution":{"observed_at":"2026-07-04T20:30:07.815811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-02T10:14:12.944746Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.25971","last_updated":"2026-07-17T13:42:08Z","snapshot_observed_at":"2026-08-02T10:13:56.529128Z","submitted_at":"2026-06-24T15:40:26Z","title":"Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-02T10:14:12.944746Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.25971"},"observation_digest":"sha256:6c33534338a70f1c8461450af28889a2faf5bb289b0edf5da6a6d41af2fbf140","observation_id":"d0ce3013-56c9-42f3-8993-87acf7fe0c60","resolution":{"observed_at":"2026-08-02T10:14:12.944746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2606.30831","last_updated":"2026-07-23T18:53:12Z","snapshot_observed_at":"2026-08-04T02:09:09.481541Z","submitted_at":"2026-06-29T19:01:43Z","title":"Geometric Dyson Brownian Motions and the Free Log-Normal Limit for a Non-Square Gaussian Matrix Product","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T01:42:14.145227Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.30831"},"observation_digest":"sha256:08ae81531b7227a87bf7f4fdb60089c76da37c7317a85ab717167825c251e38d","observation_id":"323bfc35-c383-4d2e-84ee-2b2faada5d28","resolution":{"observed_at":"2026-07-01T12:45:44.992051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-02T09:36:52.548930Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30831","last_updated":"2026-07-23T18:53:12Z","snapshot_observed_at":"2026-08-04T02:09:09.481541Z","submitted_at":"2026-06-29T19:01:43Z","title":"Geometric Dyson Brownian Motions and the Free Log-Normal Limit for a Non-Square Gaussian Matrix Product","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T09:36:52.548930Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2606.30831"},"observation_digest":"sha256:9a0a6188e3142ae65526e9db281172810ba66e1a07522c0c7caaabc220bafd82","observation_id":"cd3b708c-ec2c-4b61-bcfe-e8f332637497","resolution":{"observed_at":"2026-08-02T09:36:52.548930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-12T16:22:39.179665Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03634","last_updated":"2026-05-19T20:30:18Z","snapshot_observed_at":"2026-08-08T15:55:00.279688Z","submitted_at":"2026-05-19T20:30:18Z","title":"The Role of Rigor in Artificial Intelligence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T16:22:39.179665Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.03634"},"observation_digest":"sha256:31dcac26069681fe76c482e88ba2fe0b19d8586277028a6d192ae17351d9f99f","observation_id":"e15db8af-203a-4c7f-9dfb-862f7c416441","resolution":{"observed_at":"2026-07-12T16:22:39.179665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-14T14:51:11.146058Z","title":"Tensor programs V: Tuning large neural networks via zero-shot hyperparam- eter transfer.arXiv preprint arXiv:2203.03466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09885","last_updated":"2026-07-10T18:19:47Z","snapshot_observed_at":"2026-08-09T18:26:30.817269Z","submitted_at":"2026-07-10T18:19:47Z","title":"Index SLM Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T14:51:11.146058Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.09885"},"observation_digest":"sha256:1572089db3fd79f24d86c8d7372b7da3ed4c405210cc07331e387a0760569e78","observation_id":"6143a722-f2b9-467f-bd1d-61bb7bc87469","resolution":{"observed_at":"2026-07-14T14:51:11.146058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-30T12:53:41.041793Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:41.041793Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:7d04ebcea982c64dec43ac77417036e3629b10cc117ccbec699855a88849639f","observation_id":"38cbf6cf-6290-4515-aa64-80b98712a8be","resolution":{"observed_at":"2026-07-30T12:53:41.041793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-01T03:02:01.193632Z","title":"and Babuschkin, Igor and Sidor, Szymon and Liu, Xiaodong and Farhi, David and Ryder, Nick and Pachocki, Jakub and Chen, Weizhu and Gao, Jianfeng , month = mar, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-08T08:44:07.330246Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:01.193632Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:f440dcf348fbcb4679c07b77ac12afb19ef7bb32c9d777ba706006dc878f95ed","observation_id":"4feb1af7-058a-4472-a586-d05d034f1dd2","resolution":{"observed_at":"2026-08-01T03:02:01.193632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-07-31T02:16:08.253839Z","title":"Hu, Igor Babuschkin, Szymon Sidor, Xiaodong Liu, David Farhi, Nick Ryder, Jakub Pachocki, Weizhu Chen, and Jianfeng Gao","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28611","last_updated":"2026-07-30T17:58:02Z","snapshot_observed_at":"2026-08-10T02:38:10.681528Z","submitted_at":"2026-07-30T17:58:02Z","title":"Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-31T02:16:08.253839Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.28611"},"observation_digest":"sha256:ac9e0f76555f6cf56807d71b0e9c14888c33b213c0fe933eb93fb1b3a2a5f5cb","observation_id":"f9cc9133-94d9-4698-a52f-d1cec4bca3cb","resolution":{"observed_at":"2026-07-31T02:16:08.253839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-03T02:09:02.591486Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS), volume 34, 17084–17097","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29674","last_updated":"2026-07-31T17:54:46Z","snapshot_observed_at":"2026-08-07T05:35:20.518953Z","submitted_at":"2026-07-31T17:54:46Z","title":"Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T02:09:02.591486Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2607.29674"},"observation_digest":"sha256:6200de88c924d371933d2ea4a525100c9964247b5484eef4ccc80ab2e0d5c135","observation_id":"3d27a86f-b256-4327-8e34-4a6e96894d2e","resolution":{"observed_at":"2026-08-03T02:09:02.591486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.03466/citation-record","integrity":"/paper/2203.03466/integrity","json":"/paper/2203.03466/citation-record.json","paper":"/paper/2203.03466"},"outbound":[],"paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T09:04:57.100575Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 65 inbound Pith citation observations for arXiv:2203.03466."}