{"as_of":"2026-08-09T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04c785e98de8d7d0fe36591502e9482118ae346408ca7d458db0ec1e192a6af7","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T10:36:03.467256Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10593/citation-record","integrity":"/paper/2607.10593/integrity","json":"/paper/2607.10593/citation-record.json","paper":"/paper/2607.10593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:ec0cabea3073386c996f79c48c0daeb7d08ed104e25d256523de2474393105b9","observation_id":"ad7ba017-2600-486a-86b8-284a8c3f3b93","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:88f09ef7a82828346f02477915e46e9be134fc4718fb495bffbf52ab8c53e13d","observation_id":"1977531c-4fa5-4e53-a814-5e4a121ac63f","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:d809c0920be614c9c90c659bacbc5cc13c4a5d81e084d50b6ac79cd3f958030d","observation_id":"ea814105-7f13-43f9-b8c0-bb592f0f2cca","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Categorical reparameterization with Gumbel-Softmax,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:5d514bde9dd55ce60adee4ff4691e62d3e8e6836b335b6d1d5c7b3b543fdc816","observation_id":"a9df3cdc-c1d3-43aa-9987-06bf2b634104","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:ed83aea88106a6128b73bc78b1d59591cbdbfa2bbaf02adc358f47ef61254aff","observation_id":"bb37de26-d566-4a95-8519-b06c9ee5f16f","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:674cd27535c621090a562fb0acaf138c0ec846b21a5813188ff3f0df7338f01c","observation_id":"9c488932-bd52-490a-b10f-d04e4964167d","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"On layer normalization in the transformer architecture,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:7ae025c2c38700844e162d010282c6a8b66aa881d45248c0f81e317e2723de43","observation_id":"1fc35617-7584-496d-999e-1d80b6d28a54","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Benchmarking neural network robust- ness to common corruptions and perturbations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:0ec4ede5d7ec9c981698b57ebd6aa3db829b3c49cd47ae49310a80e06afc12d8","observation_id":"15e7fd4d-20b5-4f4f-924e-49de83a1eedb","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Fixup initialization: Residual learning without normal- ization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:22e3121e621ec4669fcaceb2334786212b65355ece12a608b23ee2fe49971fe8","observation_id":"83bed5a6-8b6a-406b-a1a5-7e9fa8615a09","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"In search of lost domain generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:069a93da5d6efbcaa760b3b4f977fe6645d495a013e5391c72f4a9f6595cc8a9","observation_id":"dd301e37-b835-4eed-9729-f211585111b6","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"DARTS: Differentiable architecture search,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:2f51a0d92e1cd042de996baa05cbc11a3631f0e58e8b9a6e26f5c46d7cbe730e","observation_id":"a4d183a4-8ee8-429c-ace9-e6645bb6ad14","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Neural architecture search with reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:aeb85a9114298109e8d3c7dd8aab7f77b963b5467fc77f64ad370e209eba755a","observation_id":"29795267-fccc-49fc-94cc-1666b2629224","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08022","last_updated":"2017-11-06T14:21:43Z","snapshot_observed_at":"2026-08-05T08:35:49.218794Z","submitted_at":"2016-07-27T10:23:00Z","title":"Instance Normalization: The Missing Ingredient for Fast Stylization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08022","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Instance normalization: The missing ingredient for fast stylization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/1607.08022","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:faac094c6292e5bf68dec5668179ae0cb15b0ce881c0ff7e0906712cc5c6849f","observation_id":"6d277e3b-9cc5-48e6-abab-32530f3bba22","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Group normalization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:5f316fc8f8b337ba4e5cd37ae546baffcbaab736988d964435d99be7386ff2c2","observation_id":"1ac2bb0c-60f2-4a45-87d3-9eef3ca4b8f8","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Adaptive batch normalization for practical domain adapta- tion,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:ec53d7522bb826c68f071bab255539a7e84342522c6891eff0513e8105c67608","observation_id":"b7acb265-2653-49a3-9718-0ac4be3f8712","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00555","last_updated":"2022-03-01T15:36:38Z","snapshot_observed_at":"2026-08-07T12:15:22.242632Z","submitted_at":"2022-03-01T15:36:38Z","title":"DeepNet: Scaling Transformers to 1,000 Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00555","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"DeepNet: Scaling transformers to 1,000 layers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/2203.00555","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:1058a1275809b14644c676e39b19379f2363dd88c065f6a010b340ec88281841","observation_id":"a5f73626-9260-4004-bab3-cfcd8552fb0b","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Delving deep into rectifiers: Surpassing human-level performance on ImageNet classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:b5f46d7498ef4559d3e38ed2848488bfd293bbc9f4f959ba2061782a699faf10","observation_id":"608a5f0f-5303-456d-aef4-64a9b3611094","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Searching for activation functions,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:73b77de320cbcd40f923fb7883c1144e558261fff8547e3fc6d428345a30f66c","observation_id":"a988d1af-9179-4855-a36c-bbf2abab56c1","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Activate or not: Learning customized activation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:f125c22c0c56fd7b597cd96293ba3dd28584450bb2c2b15b40b42f3231ccd74a","observation_id":"e0d2c989-d995-4523-a567-03e670c16a90","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Squeeze-and-excitation networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:e2b3df19036a09549a4831bd068e4c2af6d19a1ece6c504cdb7c78d18c065ef5","observation_id":"8458c5a2-a322-4274-8f88-a9df40485e89","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Dynamic convolution: Attention over convolution kernels,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:9d1f86d7890a4001fb7eb2e64a5af7e858e5b2f61b556bdba1a23c728d384142","observation_id":"2a9df2a7-cd30-4dce-a1b7-6c86493b0c09","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Adaptive subgradient methods for online learning and stochastic optimization,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:c0d8b5c9b77f8d01c24c617216bd9d1175a24c70dbbc32cef15d64231e3adb1a","observation_id":"1736251f-8a51-4e8f-8de6-171c454ac425","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"AdaBelief optimizer: Adapting stepsizes by the belief in observed gradients,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:55a736da2f09e058f5e8bcdfec4d924074c2b1589fa1da82f887caad41c51002","observation_id":"69d34855-7d85-4688-af9d-593060a275c5","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Root mean square layer normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:66fd0cd64438f7c34c96b1bce74ce0cc257d3b435ef293c3c925c6f6e8ecc92a","observation_id":"f4fe2f35-a3ea-42c4-849e-78601196b7fa","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"ReZero is all you need: Fast convergence at large depth,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:0224a26123c3a0d584b69866c4b82e9c18eda0a544278ec5f72279c972d21626","observation_id":"247fe0f6-be54-41ee-9a65-ff2d619d5b81","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:e1b011c5279329ea2d57ffe1173282fdfa6fe2ee2f570773f28c34d9bd87fa18","observation_id":"1c90b444-1f5b-4b6b-bfe2-4f1ab21f905e","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"CutMix: Regularization strategy to train strong classifiers with localizable features,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:8313bd2f5c26c9836298bc7ff510f5d761d934cac22394e9375e1e81307b2ba8","observation_id":"878ec45b-59c6-477d-94fd-61256f4e2851","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:1ae3820bee5c6f9bda97a0588061d81a6295b006891ade48b8dce6e8e71e8c1d","observation_id":"ccbeb99e-2d7d-477c-98ea-507dabe0baaa","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Outrageously large neural networks: The mixture-of- experts layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:5124509fd99da3991ad1bda9f2592226d68c11de57ab7699c769aa9803763dd3","observation_id":"ecf4811b-00aa-48bb-91ec-dddb2150f090","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Transformers without normalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:6e7b41084dd8b9d7b184d95ef8bd13a79d34b81c915a7f70ce1808708645557f","observation_id":"f3092301-5d49-4e3d-b339-9f508897ca38","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:e9c6eff5ace453aad4463a3acdbc44f456a0a9114bd471f9cfcfa5fb65c00cf5","observation_id":"38904f77-3772-45fb-a367-4c33c738596a","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05704","last_updated":"2022-06-07T19:25:30Z","snapshot_observed_at":"2026-08-07T09:29:25.938148Z","submitted_at":"2021-04-12T17:58:56Z","title":"Escaping the Big Data Paradigm with Compact Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05704","snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Escaping the big data paradigm with compact transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"cited_paper":"/paper/2104.05704","citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:f4358e17b85ae5cb573ffc02fa0750f49b861305c5fcd2af599ebbeca5345135","observation_id":"0be5c44d-127c-4cba-be13-54d86c005763","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Building a large annotated corpus of English: The Penn Treebank,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:ede41f6497409e20fecd12607e9d54e0f8bcfac4b587a1a8832efb7a79456595","observation_id":"582581c6-94f5-4621-9ae5-f6e129b35906","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Differentiable learning- to-normalize via switchable normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:c9be88e6a51a40ecc5181741334c64d77fc70d4689bb95e5871aa718ae65a4cd","observation_id":"99d2c105-1527-4fcd-89a0-06fec2f9c75a","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:03a20ebc0ddb517e925cecfc2512fa3c502ba12c70fb459088e33d85718ee278","observation_id":"0796bb42-5d71-4fe7-aec8-5da9a8b2cff5","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Going deeper with image transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:103f637b103447a7f563d6d9749f98219e7d30f0cedcde8dc22e01773479447c","observation_id":"71074e04-1332-4da4-bf24-4b51f2b3cbf3","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T10:36:03.467256Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T10:36:03.467256Z"},"links":{"citing_paper":"/paper/2607.10593"},"observation_digest":"sha256:50897aa585a265d6833288579cbc81d0054cf0cfc04b644af6afac45fd7aa6ac","observation_id":"b4c82f2b-6c57-46df-bc2b-7664954a3486","resolution":{"observed_at":"2026-07-14T10:36:03.467256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10593","last_updated":"2026-07-12T06:12:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T01:23:59.952725Z","submitted_at":"2026-07-12T06:12:37Z","title":"AutoNorm: Understanding Adaptive Normalization in Transformers through Differentiable Gating"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.10593."}