{"as_of":"2026-08-10T01:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffb6ba512ebaabde8f14dceee42159b13a26a0e997dac9e44a98ade92d0923f6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:54:29.313148Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:34:21.647564Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-09T14:54:29.313148Z","title":"Transformers can achieve length generalization but not robustly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01612","last_updated":"2025-02-13T05:32:54Z","snapshot_observed_at":"2026-08-09T20:44:40.485078Z","submitted_at":"2025-02-03T18:45:22Z","title":"Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-09T14:54:29.313148Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2502.01612"},"observation_digest":"sha256:12e419cc4a0afb99242a40b62a56a276ccbb53b97732f8d1dd88cdac89a34633","observation_id":"ed0a5139-5a66-4877-b5c2-670c1858af3d","resolution":{"observed_at":"2026-08-09T14:54:29.313148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-07T20:21:58.420988Z","title":"Transformers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09844","last_updated":"2025-05-28T00:52:33Z","snapshot_observed_at":"2026-08-09T11:39:39.690395Z","submitted_at":"2025-02-14T01:06:15Z","title":"Solving Empirical Bayes via Transformers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T20:21:58.420988Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2502.09844"},"observation_digest":"sha256:67696904af3cd18eb36ceee05cc433d8edae868d5f1a6f2175be180db89a2c66","observation_id":"8032c346-8008-47bd-adf7-2eb85dbd9d64","resolution":{"observed_at":"2026-08-07T20:21:58.420988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-07T04:59:24.440272Z","title":"Transformers can achieve length generalization but not robustly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09251","last_updated":"2025-08-04T16:57:32Z","snapshot_observed_at":"2026-08-08T23:23:45.447296Z","submitted_at":"2025-06-10T21:22:51Z","title":"Extrapolation by Association: Length Generalization Transfer in Transformers","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T04:59:24.440272Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2506.09251"},"observation_digest":"sha256:5683bd59e2e60d753a771754a46ad9638baf22af5562e727fd9a97dcd76d17f7","observation_id":"fe812d76-337a-468b-bb5d-f301e3e82b77","resolution":{"observed_at":"2026-08-07T04:59:24.440272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-06T05:02:54.113287Z","title":"Preprint, arXiv:2402.09371","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02513","last_updated":"2025-08-04T15:18:41Z","snapshot_observed_at":"2026-08-07T00:37:07.660701Z","submitted_at":"2025-08-04T15:18:41Z","title":"Modular Arithmetic: Language Models Solve Math Digit by Digit","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:54.113287Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2508.02513"},"observation_digest":"sha256:ddf3b83c57b7fbc0dbdac29c55804521707f5b8cfb1978729ea7dad738360659","observation_id":"579aac01-1df6-4128-9d10-723a59c6d0b5","resolution":{"observed_at":"2026-08-06T05:02:54.113287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-04T15:34:52.272478Z","title":"Transformers can achieve length generalization but not robustly,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.19658","last_updated":"2026-06-18T08:54:34Z","snapshot_observed_at":"2026-08-06T07:45:26.732940Z","submitted_at":"2025-09-24T00:26:15Z","title":"RoboSSM: Scalable In-context Imitation Learning via State-Space Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T15:34:52.272478Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2509.19658"},"observation_digest":"sha256:4c133f174a44df0fd97f915bdd4bc8af53a98e5b130c954faf44a9f82fe65110","observation_id":"108e7b8b-3fad-44cb-9056-c445807f3429","resolution":{"observed_at":"2026-08-04T15:34:52.272478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":"2402.09371","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-06-30T07:34:21.647564Z","title":"Transformers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371","venue":null,"work_id":"37bb45bd-42d1-4a29-b347-b416afa5f701","year":2024},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-02T20:03:37.497118Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:039843081a9e13bfcb0bad1a61df37bafaacc970a98006a46c73fc412905fb19","observation_id":"a3786f78-e500-493b-bace-9e37937f4f5f","resolution":{"observed_at":"2026-05-18T10:21:15.156327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-03T15:22:56.533047Z","title":"Trans- formers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.17351","last_updated":"2026-07-28T16:53:50Z","snapshot_observed_at":"2026-08-03T18:14:53.588030Z","submitted_at":"2025-12-19T08:47:28Z","title":"Physics of Language Models: Part 4.1, Architecture Design and the Magic of Canon Layers","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T15:22:56.533047Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2512.17351"},"observation_digest":"sha256:d0a6853ed0efc627a392925e973a4a4f8c88e460b3258b662582c5a40b31a6dc","observation_id":"bfb8451c-1e11-4550-b7c8-7a03984e3069","resolution":{"observed_at":"2026-08-03T15:22:56.533047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-02T23:03:08.444115Z","title":"Transformers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15136","last_updated":"2026-06-22T12:21:25Z","snapshot_observed_at":"2026-08-03T05:55:36.234632Z","submitted_at":"2026-02-16T19:29:27Z","title":"Universal priors: solving empirical Bayes via Bayesian inference and pretraining","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T23:03:08.444115Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2602.15136"},"observation_digest":"sha256:b268780f890ddd5e6d6fc0b9876ddd49dda50486963c3d8641352c9fde16c5da","observation_id":"c4ef6ee2-10e3-43c1-949f-70ce9c48904c","resolution":{"observed_at":"2026-08-02T23:03:08.444115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":"2402.09371","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-06-30T07:34:21.647564Z","title":"Transformers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371","venue":null,"work_id":"37bb45bd-42d1-4a29-b347-b416afa5f701","year":2024},"citing_paper":{"arxiv_id":"2604.25166","last_updated":"2026-04-28T03:15:44Z","snapshot_observed_at":"2026-07-06T23:11:02.043135Z","submitted_at":"2026-04-28T03:15:44Z","title":"Training Transformers as a Universal Computer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T16:36:19.729400Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2604.25166"},"observation_digest":"sha256:eaa996e581df486efc4dd17795146f1dd4d66022d595838f4e019421da4f2ed9","observation_id":"b6b0c5e7-c3f6-4f1b-bf6c-8863b058e245","resolution":{"observed_at":"2026-05-11T23:36:38.611736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":"2402.09371","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-06-30T07:34:21.647564Z","title":"Transformers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371","venue":null,"work_id":"37bb45bd-42d1-4a29-b347-b416afa5f701","year":2024},"citing_paper":{"arxiv_id":"2606.29983","last_updated":"2026-06-29T08:58:09Z","snapshot_observed_at":"2026-08-03T21:27:41.768539Z","submitted_at":"2026-06-29T08:58:09Z","title":"Stabilizing Extrapolation in Looped Transformers via Learned Stochastic Stopping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T07:29:23.786653Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2606.29983"},"observation_digest":"sha256:0ddfb839a44c5b6a82e5aa86dfa17fa453dca35db3990de29af4b1e74c745d89","observation_id":"6e5c965c-3f12-45e8-b075-0657dcfcd3b4","resolution":{"observed_at":"2026-06-30T07:34:21.649547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-01T21:30:59.895468Z","title":"arXiv preprint arXiv:2402.09371 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16072","last_updated":"2026-07-17T15:56:52Z","snapshot_observed_at":"2026-08-05T22:03:26.987913Z","submitted_at":"2026-07-17T15:56:52Z","title":"Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T21:30:59.895468Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2607.16072"},"observation_digest":"sha256:a697a9341bbea4917c70e125847b5413ca135aa3d35c9334f1cd4edab17d013f","observation_id":"b6c385d0-34b3-45b9-b7c2-f386bbc47f0b","resolution":{"observed_at":"2026-08-01T21:30:59.895468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-01T17:31:51.052680Z","title":"Trans- formers can achieve length generalization but not robustly.arXiv preprint arXiv:2402.09371,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17624","last_updated":"2026-07-20T07:26:17Z","snapshot_observed_at":"2026-08-07T13:43:21.717264Z","submitted_at":"2026-07-20T07:26:17Z","title":"Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T17:31:51.052680Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2607.17624"},"observation_digest":"sha256:3c368ad9998a987f84223887986cd80650be8a0bb794d8f00083969e4835e00f","observation_id":"a4b9378a-c2d9-474f-b263-f0e7834c0e1f","resolution":{"observed_at":"2026-08-01T17:31:51.052680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.09371/citation-record","integrity":"/paper/2402.09371/integrity","json":"/paper/2402.09371/citation-record.json","paper":"/paper/2402.09371"},"outbound":[],"paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T06:01:35.329783Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2402.09371."}