{"as_of":"2026-08-21T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ed3c4373f265b70a674a12a84880d84ea651845a780a0654124c70c11493074","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T04:17:58.962415Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09266/citation-record","integrity":"/paper/2607.09266/integrity","json":"/paper/2607.09266/citation-record.json","paper":"/paper/2607.09266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"W., Pfau, D., Schaul, T., Shillingford, B., and de Freitas, N","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:951e116d701538e957eab3608c62409473847592e13da6bd197cb8ae098eec9c","observation_id":"8cbeb75d-54bd-407e-b200-5cb587aa8cc2","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"signSGD : Compressed optimisation for non-convex problems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:5957cca1c1bbd807bdb4455b3c00387d9ae6c985df392d35ded4b61edce46c9f","observation_id":"a25c34a1-1b4b-42a0-934a-2484819e7bfd","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:13707e16175e67cdedf51c3ae0f95a508657f27a437a29c724d7995b6da285b8","observation_id":"5bdcdcfa-fd1c-4836-9257-62c448bfac8e","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Z., and Talwalkar, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:b39af9b13663a2b0b1ef8b9c8907266bb5e9d8b02c8148283fe2a32bbd06d228","observation_id":"f6d98635-3bc1-4f66-bd4a-12b8920293a5","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Mishchenko, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:6aca0d2d056d77c7394b0b77a64409a68632affeeea94fb3c119e15f649ebea1","observation_id":"70787327-038a-456b-bae0-314679f04184","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"The road less scheduled","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:8acb85a76e36a994a601c2251214b867b39f7e0307b2e3601ac18eb77854e6a4","observation_id":"c3eef540-d207-4514-83a2-3e8c98749e23","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:f7b7c42aa58a9861b65e6815abc0350c211b70ec3954246a35046e1b8506f592","observation_id":"ba9c237d-58c4-43d8-a5b2-868dd2fb934b","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:ad5ff215266a479a03b803f4e92920b9b7cdee21e8960d1adabb8260e4f43fc1","observation_id":"08cf2aab-f2b3-4e81-9178-8056e98fc953","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:18b4f65cd5112c98072443b2a77337fb474e065884406a7720001a5523bd20bd","observation_id":"c79e9384-e9e9-428c-ac9d-26edfcdc1110","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Noise-adaptive layerwise learning rates: Accelerating geometry-aware optimization for deep neural network training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:f01c8d2779a8e8a31a9629d0fafeef6043d2d8049e96b1f4abbb78058ec79fc2","observation_id":"4f3828e8-d530-4011-9151-3ab64144bf3d","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Ruder, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:436f8b78413ca8e27ab777836162a74eecc7da5771fabde42d70f3839825c38c","observation_id":"4db50434-f295-4ccb-9b54-85a1307e4a6c","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:8c960392f21c8d1c63e1c1ca4ce2b6428f2d47c7bf65715f7d0cf9451e4eef5d","observation_id":"06a976f0-f5bc-4e5a-83ef-8f5eb0e1c079","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:2a2b2ab4d901df86e19e3812e5e4d5b6dec49476bd7875433b60f706bb80b10e","observation_id":"8110590f-a14b-43e2-b304-8267cd8fde8c","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Cautious optimizers: Improving training with one line of code","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:074244a08390cc8db1a8ba6dd467094cf025d7523ea5291a3fdb1618640e36ad","observation_id":"6e190b7d-e15c-4c28-8802-d27bbc39398d","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:02ae43a9ee87e70c4f41d52ccf7678eeb69e1aa999f0db02a49612a9f04f7db4","observation_id":"03d906d2-8255-4f6f-92c7-f7c5afb7113b","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:1f8f8315536d68c82c250de06289f911e6b6de4eee45501e1f1d573ff1757d0f","observation_id":"933195f3-a949-4f29-abd7-513c4181c0f2","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"PyTorch : An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:cbf6e442a5b40511c9be1d9652efe1cb255d58e796812bc8541548a76993f5ee","observation_id":"3fd542f2-6995-43d6-a295-1606c06ae251","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04358","last_updated":"2024-07-05T08:53:06Z","snapshot_observed_at":"2026-08-16T13:36:52.207136Z","submitted_at":"2024-07-05T08:53:06Z","title":"An Adaptive Stochastic Gradient Method with Non-negative Gauss-Newton Stepsizes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04358","snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Xiao, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"cited_paper":"/paper/2407.04358","citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:0b7b2edb8c810f6262264b5177e75d6cab788a3c5fc85e4dfc321d11da12c989","observation_id":"2f8aa75b-f52d-4c33-8878-41e9c90174c3","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"M., Schneider, F., and Hennig, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:f539248f840b28120e58d3e60f4739a305de660ca867c0d90f722fc44cda40b1","observation_id":"e959b445-3a50-4007-a07d-6cc5159f9fa0","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:848410181b3eae427d659a1a7fd7136143f4cce015baf2a7287bd7d14ef9f20f","observation_id":"2fb2fa15-5ce9-4da5-885e-850f11a83116","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"AutoDrop : Training deep learning models with automatic learning rate drop","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:fef48dfe024164bc314920d5fc946405e9f67a3073805725b23036a0dac93295","observation_id":"08f26162-caec-4d28-932a-a891112e0e4c","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:d49173ec64dc43266ee7e9deb1a79df4b5dd5abeb721adae7cac34c559c7f51a","observation_id":"3753eee2-05cc-4415-96a8-1515526e9942","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Large batch optimization for deep learning: Training BERT in 76 minutes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:962a0398a25e37c93b34812a73b43d22d682868e8bc6a5976afdd8534816d651","observation_id":"8bff8c94-5546-4ab1-844a-34b1016ae3e4","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"and Komodakis, N","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:0e67c94ec4b1c932eec5d6e7da853b1949628e59c969405cc7c81b6dd13ca21c","observation_id":"d75d1813-ca1e-414e-b112-a713f5e00568","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T04:17:58.962415Z","title":"Deconstructing what makes a good optimizer for autoregressive language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T04:17:58.962415Z"},"links":{"citing_paper":"/paper/2607.09266"},"observation_digest":"sha256:3371d69635741f7446bb0d4ae8cf4c575e4b856909a0f1f486e80ed5a73f08e0","observation_id":"28f9fdb4-e44b-4966-b24c-0d1186f6183a","resolution":{"observed_at":"2026-07-13T04:17:58.962415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09266","last_updated":"2026-07-10T10:30:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T00:29:18.555849Z","submitted_at":"2026-07-10T10:30:46Z","title":"LionVote: Per-Layer Learning Rate Adaptation for Lion"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.09266."}