{"as_of":"2026-08-11T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:839c2c9a64f62c07b4a95da3b7ee47d108e34924e9ac339218d0519dfb2ee19e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T03:50:43.744189Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.21292/citation-record","integrity":"/paper/2605.21292/integrity","json":"/paper/2605.21292/citation-record.json","paper":"/paper/2605.21292"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agarwala, F","venue":null,"work_id":"69f2fef1-4551-4b79-9121-cb78176c782b","year":2023},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:3fd1835c73a518f8239112b651978777d15051ec6000be8f13aa0b4b9f07c65f","observation_id":"f5d209e1-5601-4424-844f-0e06e7549681","resolution":{"observed_at":"2026-05-21T03:54:31.928482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arora, Z","venue":null,"work_id":"01adb6cc-64d3-4909-8222-10e3f82ddaa2","year":2022},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:4f57e28d9bf2d9f0857fcbb4a0cba9bbb559640be99ee621b56dd9ded46429f3","observation_id":"bdd73763-e1bb-4e45-a816-2ceab5aa52e8","resolution":{"observed_at":"2026-05-21T03:54:31.943368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen and J","venue":null,"work_id":"794ca954-a152-4bf1-b923-4b8e3be578de","year":2023},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:dace5fe99db4c3b89e254bf2e52229f63d7f43209ba1d7a0f5b040cd9bfe93cf","observation_id":"1d8415ba-7b8d-424d-82d1-ea87533ef884","resolution":{"observed_at":"2026-05-21T03:54:31.930502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83575c3f-19f3-4fd4-9da9-fabf823ada88","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:72d4cd8011d3d6f271133a669c9fd8069cbec77bd40aa0c04fc1961715b8151c","observation_id":"d4fb99a7-3ab1-4129-9b1d-1c562c2dbf86","resolution":{"observed_at":"2026-05-21T03:54:31.932515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cohen, S","venue":null,"work_id":"e1bcfd0a-0b58-45ed-a560-07617c8f33eb","year":2021},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:997947bb1dd7c728e1cd40110702d17c61872a022acfd764b7034956d6df2e5b","observation_id":"e7a35c0b-6cda-44f4-99ea-2db1ff6314fb","resolution":{"observed_at":"2026-05-21T03:54:31.934356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Damian, E","venue":null,"work_id":"16bc20db-0abe-4a13-a602-dad24de35303","year":2023},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:2cface27df2dd5193b1772f684c1135e069e1338e07c7dcdb36514cb623a4ab4","observation_id":"5ea17e0b-1bf7-4d11-a7ee-44162f2fddd9","resolution":{"observed_at":"2026-05-21T03:54:31.936364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c7207e3f-23a9-45fc-9159-67a3e0d86891","year":2003},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:54d07f161e9ecb6439439823a8f428a2b24cdb3bc9aa880132a592cd908930de","observation_id":"b3b19251-28bc-4501-a3f6-9b6c412c0732","resolution":{"observed_at":"2026-05-21T03:54:31.938089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gilmer, B","venue":null,"work_id":"d140e46b-3765-4fb1-9b54-a275c9c1ae01","year":2022},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:3181ee3c2ecba3af943c146cd01c3272a170865edfd7ff0823d99dd383e126cc","observation_id":"983885b9-19bc-40ac-b019-3ca990ae1752","resolution":{"observed_at":"2026-05-21T03:54:31.922460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Herrmann, M","venue":null,"work_id":"09032713-113e-471d-9520-eee69aebe204","year":2022},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:2fbddfb62410505d0b9bd13b63c79146f9e5a6209d5632325399309dea4ecb44","observation_id":"6fd1fdbb-de70-4451-a651-f33f353957d4","resolution":{"observed_at":"2026-05-21T03:54:31.924479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kodryan, E","venue":null,"work_id":"f98d5510-bd73-4a93-bec2-517432d28cc6","year":2022},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:c2d4ca90b1857234f856527c6e5bcbff227a41ffdb43a07224ddb70ed814f6ad","observation_id":"b51800bb-ebf5-4b23-a801-d8fc0c630322","resolution":{"observed_at":"2026-05-21T03:54:31.926598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kong and M","venue":null,"work_id":"8ad97d2b-1e4e-4237-be1a-5b422f348275","year":2020},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:398c9bb15ab66e792a2060e50fd88338415fd0801444a270596801ec43983552","observation_id":"53651514-6e85-46ac-9462-31e468b4cc65","resolution":{"observed_at":"2026-05-21T03:54:31.913473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02218","last_updated":"2020-03-04T17:52:48Z","snapshot_observed_at":"2026-08-08T21:43:40.840815Z","submitted_at":"2020-03-04T17:52:48Z","title":"The large learning rate phase of deep learning: the catapult mechanism","version":1},"cited_work":{"arxiv_id":"2003.02218","doi":"10.48550/arxiv.2003.02218","metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The large learning rate phase of deep learning: the catapult mechanism","venue":"arXiv (Cornell University)","work_id":"fdbcc7a5-2170-42dd-8424-9e228495e447","year":2003},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"cited_paper":"/paper/2003.02218","citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:c47fa2c8f5997ee1e075010a423e785d7a68350b434ab892859c5a998ad246f5","observation_id":"d622889e-88bb-4c7b-a0d8-efc3a61dd255","resolution":{"observed_at":"2026-05-21T03:53:56.329810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:49:36.486557+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:49:36.486557+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liang and G","venue":null,"work_id":"ddd3dbc0-a71c-40fe-a194-67bd60312b73","year":2026},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:7bce0099a625ea6c05fc1faec722b601460a45ad7abb0a4d5c5a130015cca5ea","observation_id":"4c3c99f1-ca06-4919-85ba-8321b7375674","resolution":{"observed_at":"2026-05-21T03:54:31.920689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lobacheva, M","venue":null,"work_id":"63de0d2f-44e1-4a78-8ed7-9a737b127a7f","year":2021},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:a3d54d969b9b728e9506b4de6e6ceedc9be1d0790422e7b1a528b02b9cc3a592","observation_id":"dd47994d-6d3b-449a-a8b8-88eec03d2ec7","resolution":{"observed_at":"2026-05-21T03:54:31.940576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6458.1992","doi":"10.1080/10586458.1992.10504242","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":null,"venue":null,"work_id":"6186ee69-38c0-463b-a86c-9ae8092445e9","year":1992},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:989e9eb5c077c050b59b10ddeac8c2ab240f59428debc3743abe3222e460a59b","observation_id":"7e81b792-66a6-48a9-ab5f-cf3553860d16","resolution":{"observed_at":"2026-05-21T03:53:56.123528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:23:41.736878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:23:41.736878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s002200050018","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Communications in Mathematical Physics","work_id":"3fe9dec5-4ed6-43b8-8626-ef7e2b268193","year":2000},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:1ca5ea3596535d2b7825e30669f55225a6925e654c9d85f358c41f7ce1d4567d","observation_id":"6b683292-5b24-439b-80fd-83bd99316e61","resolution":{"observed_at":"2026-05-21T03:53:56.125643Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:23:42.095988+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:23:42.095988+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Song and C","venue":null,"work_id":"1ff5c9b5-eba0-474d-b62e-8dff0e308c2d","year":2023},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:8752a150e1cd40fffb494ea4c80ad10c8487c2dfda4b8aad511bf786ea49c167","observation_id":"91e3ef30-65cb-4858-ae65-0cca4258bddc","resolution":{"observed_at":"2026-05-21T03:54:31.905923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d7e7599f-d9da-4acb-ac4d-244b64491281","year":2022},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:12699005a6245b33d3a5d5c9d4a4245c299668f8af0279a0785f4cb3f7fdaabb","observation_id":"4f34c2fd-964c-446a-a1bc-98c45164c2e1","resolution":{"observed_at":"2026-05-21T03:54:31.911550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3c4e5ffa-5b57-452d-8d92-43061871b409","year":2003},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:c6f17619f17470d64b6c197685920d6abe33112a3288efad3626dfd9c1b17447","observation_id":"ecba862e-689e-45a9-bdd4-b31f835b838a","resolution":{"observed_at":"2026-05-21T03:54:31.899755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wortsman, P","venue":null,"work_id":"056d1aa4-50ec-4db3-911a-3e175eec5351","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:3d3fb2e806415785969acb6f3c5732eb91d6e648fd3201874ba021aca8a117af","observation_id":"8793b784-a621-4a2d-843d-9b08cde2db7e","resolution":{"observed_at":"2026-05-21T03:54:31.909706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68643f44-9eb6-4fb7-af55-31ff4cb0acc3","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:76079cd720eae65bc91176dc520a67dda72dbe7c584c2f356cd2a8891750c317","observation_id":"965f02d2-fb2b-437c-b4cd-7458c5415c68","resolution":{"observed_at":"2026-05-21T03:54:31.895611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b0d47f20-aa9c-4464-9db1-2a0fdac40eb9","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:80d039502c76ecb7e6a14b82b537c6f4bffcbb3eca8cda24228e68aa8f7ee781","observation_id":"d82ddbac-7e15-4db4-83ba-8f9fb95c6f81","resolution":{"observed_at":"2026-05-21T03:54:31.916015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.02336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:39.663525Z","title":"Large stepsizes accelerate gradient descent for regularized logistic regression.arXiv preprint arXiv:2506.02336, 2025","venue":null,"work_id":"3eca26bb-b43e-4dcb-8103-c3ac46b309e8","year":2025},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:a261938d20fc7fc0c5f243abe5b3a0816e981d8b7d953cae0feb81802e1cd9bb","observation_id":"42d4ffa1-cfe9-40c3-8cb2-c3ce4d16f8aa","resolution":{"observed_at":"2026-05-21T03:53:56.332902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, H","venue":null,"work_id":"4ab82565-7925-49dc-a262-d4b74be6d14f","year":2022},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:e00a450a69c64d22e8864db8d499693d8871d76dd12fd75814e67ae9660bbd55","observation_id":"19ab1d80-9d67-4d59-a516-132dc6fbf638","resolution":{"observed_at":"2026-05-21T03:54:31.918367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, S","venue":null,"work_id":"8e590ced-988e-4724-bfd9-6b1db0bd5242","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:bbc6b91a1d83c92d6f5c275d2088a8c50c3d8b29063f05b9ee52d7e15f913a8c","observation_id":"1a36811b-dc62-4ba2-be37-6ffa5074c777","resolution":{"observed_at":"2026-05-21T03:54:31.901977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, J","venue":null,"work_id":"dc967cf6-3cab-494c-bb43-cbab7121d668","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:702262e01978ddad6f48dd9dddedec78363ef6eb1538801d70491ffb7945e31d","observation_id":"9547e8c0-9bff-40d4-90d2-27e0efbf1716","resolution":{"observed_at":"2026-05-21T03:54:31.897615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04105","last_updated":"2025-04-18T03:35:46Z","snapshot_observed_at":"2026-08-07T16:08:25.523140Z","submitted_at":"2025-04-05T08:34:20Z","title":"Minimax Optimal Convergence of Gradient Descent in Logistic Regression via Large and Adaptive Stepsizes","version":2},"cited_work":{"arxiv_id":"2504.04105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04105","snapshot_observed_at":"2026-07-04T07:59:39.677560Z","title":"Zhang, J","venue":null,"work_id":"f54e444d-feca-47b5-8387-1b42d922c3ad","year":2025},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"cited_paper":"/paper/2504.04105","citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:589aa2fdbd8a05cf87c435d18be76eb4309bbd003ec97a660f5be3178094f25c","observation_id":"0cd64b23-46ab-4cc5-9a2c-20647501fa09","resolution":{"observed_at":"2026-05-21T03:53:56.335715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dfb74557-76c8-48fb-b25f-9fdaa9b22f11","year":2024},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:7438ef604b6d76571b4744c23a0e833d4b6c8760498fdd45aec42c0fb8ed20a2","observation_id":"b01e7d67-bf23-4204-b131-5071bdca4b56","resolution":{"observed_at":"2026-05-21T03:54:31.903886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c2f1106e-1557-4459-a89c-e96b79174d92","year":2023},"citing_paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-21T03:50:43.744189Z"},"links":{"citing_paper":"/paper/2605.21292"},"observation_digest":"sha256:342317199a2ba41c2cdd2c61f49406d2ddcb4ac72c0ae7d0532beda4a3d2e950","observation_id":"6b9a881a-7b5b-4ea9-a771-998979ffe7b0","resolution":{"observed_at":"2026-05-21T03:54:31.907800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.21292","last_updated":"2026-05-20T15:25:13Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-01T20:42:28.027915Z","submitted_at":"2026-05-20T15:25:13Z","title":"Large-Step Training Dynamics of a Two-Factor Linear Transformer Model"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":5,"verified_fuzzy":16},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2605.21292."}