{"as_of":"2026-08-11T07:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21a44573c76c8e927cd537f9ebd59892275914a3519371af5f829e1dd10e14a4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:36:27.117603Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:06:16.211261Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-10T23:36:27.117603Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20195","last_updated":"2024-12-28T16:09:25Z","snapshot_observed_at":"2026-08-11T02:51:35.466411Z","submitted_at":"2024-12-28T16:09:25Z","title":"Lower bounds on transformers with infinite precision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:36:27.117603Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2412.20195"},"observation_digest":"sha256:dad8e116c0b45a0c8a98f98da0e8d7bcb9bee6b0d201ce5ac199f1be5dc1a7b8","observation_id":"20fcc26d-e5b9-4c05-9573-cc7ab0ef6084","resolution":{"observed_at":"2026-08-10T23:36:27.117603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-10T16:38:56.558522Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12997","last_updated":"2025-08-11T16:54:09Z","snapshot_observed_at":"2026-08-10T16:52:26.010673Z","submitted_at":"2025-01-22T16:30:58Z","title":"Ehrenfeucht-Haussler Rank and Chain of Thought","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T16:38:56.558522Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2501.12997"},"observation_digest":"sha256:5dc5633ed4102146bbfb054c9032c7ce4cf455fd58567a4b0863410e4a3c82db","observation_id":"bb59aa56-0181-4f9f-a88c-00d741943aa3","resolution":{"observed_at":"2026-08-10T16:38:56.558522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-09T12:23:57.804636Z","title":"Chen, L., Peng, B., and Wu, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02393","last_updated":"2025-07-12T18:49:06Z","snapshot_observed_at":"2026-08-10T09:22:56.267459Z","submitted_at":"2025-02-04T15:14:01Z","title":"Lower Bounds for Chain-of-Thought Reasoning in Hard-Attention Transformers","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T12:23:57.804636Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2502.02393"},"observation_digest":"sha256:492ad16a9e9f4662bbf981f2db11031ed12129ef8d7390ef90680145c1fa8ba7","observation_id":"2fff638b-a1a9-4bbf-af5d-92983cb89be9","resolution":{"observed_at":"2026-08-09T12:23:57.804636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-08T13:23:22.006914Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-08T13:14:58.702776Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T13:23:22.006914Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2502.07266"},"observation_digest":"sha256:496f5910a1a20ad8b2a118004f40f1e9af1db241c8191b431538af934de4febb","observation_id":"54a66fe2-2e84-4fba-a26c-7fc846a45aa3","resolution":{"observed_at":"2026-08-08T13:23:22.006914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T13:52:57.267988Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21024","last_updated":"2025-05-27T10:59:27Z","snapshot_observed_at":"2026-08-08T23:24:40.031957Z","submitted_at":"2025-05-27T10:59:27Z","title":"Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:57.267988Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2505.21024"},"observation_digest":"sha256:7d1b2d885d05204abb567df1b09420882963fb7e69c5cdb4250dbde98ab7795e","observation_id":"b0de0330-ed76-4636-9e78-5e132706a0e8","resolution":{"observed_at":"2026-08-07T13:52:57.267988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T12:46:33.978754Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.978754Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:ad9f42ae12742cf05109d5eb4b5a8e448e49af7631393857ce1cb7bcb19f45ea","observation_id":"23b29014-a63e-4589-8fc7-e3563d33c822","resolution":{"observed_at":"2026-08-07T12:46:33.978754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T10:33:35.409540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05200","last_updated":"2025-08-28T16:07:16Z","snapshot_observed_at":"2026-08-09T04:21:50.390154Z","submitted_at":"2025-06-05T16:12:51Z","title":"Transformers Meet In-Context Learning: A Universal Approximation Theory","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:35.409540Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2506.05200"},"observation_digest":"sha256:f61c63cb7a2c83b30efd44510ac8645e473724fc2b7ec9ed46ecd0b50e11b5e0","observation_id":"0892a673-8ad9-4bb9-8ba8-6a3aa63cfb42","resolution":{"observed_at":"2026-08-07T10:33:35.409540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T01:18:51.437766Z","title":"Theoretical Limitations of Multi-Layer Transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11891","last_updated":"2025-06-13T15:38:41Z","snapshot_observed_at":"2026-08-07T00:59:08.161672Z","submitted_at":"2025-06-13T15:38:41Z","title":"Understanding Input Selectivity in Mamba: Impact on Approximation Power, Memorization, and Associative Recall Capacity","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:18:51.437766Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2506.11891"},"observation_digest":"sha256:1a100f75f3f75830c85183d0dd1928d98e4c32c253a61b72f3f3c20948f88971","observation_id":"c7ad6197-2c7d-4432-9d5b-2249cf7b5a9e","resolution":{"observed_at":"2026-08-07T01:18:51.437766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2507.12549","last_updated":"2026-04-28T23:40:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-16T18:01:26Z","title":"The Serial Scaling Hypothesis","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-19T04:08:11.344622Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2507.12549"},"observation_digest":"sha256:e6e607156bb6c795c794a695fbc63cbb19bee746f08549b6cace7f617bf46cba","observation_id":"38a38488-424e-417c-9efa-9dbe9551f1bc","resolution":{"observed_at":"2026-05-19T04:12:02.486141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-06T11:44:04.879218Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-09T19:06:02.138099Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.879218Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:62228883ba3015e963491230af73e016435d168ed35357bca449f8c2f119c750","observation_id":"fea037c4-e0f2-44f6-83db-7d76371b6564","resolution":{"observed_at":"2026-08-06T11:44:04.879218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2510.26745","last_updated":"2026-05-18T17:56:38Z","snapshot_observed_at":"2026-08-02T20:19:54.425869Z","submitted_at":"2025-10-30T17:40:22Z","title":"Deep sequence models tend to memorize geometrically; it is unclear why","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T20:38:18.005002Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2510.26745"},"observation_digest":"sha256:e01f41a940a6042d8d61650d0569fd723b949aef55e0615c9770803d41aa6a5b","observation_id":"87de76e6-4d0e-4296-a207-0af19beb2fa0","resolution":{"observed_at":"2026-05-21T20:40:36.194169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-03T20:57:09.914249Z","title":"Theoretical limitations of multi-layer transformer, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-09T23:09:22.568411Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:09.914249Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:56845886cd7363b97a22e9f393bf999853526fc925aecadfb01cf09f1c87a1ee","observation_id":"06813133-1349-45ba-96d5-f3f7f8f2f588","resolution":{"observed_at":"2026-08-03T20:57:09.914249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-13T13:07:00.928770Z","title":"Theoretical lim- itations of multi-layer transformer.arXiv preprint arXiv:2412.02975,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03557","last_updated":"2026-04-04T02:51:46Z","snapshot_observed_at":"2026-08-09T09:57:29.723666Z","submitted_at":"2026-04-04T02:51:46Z","title":"When Do Hallucinations Arise? A Graph Perspective on the Evolution of Path Reuse and Path Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T13:07:00.928770Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2604.03557"},"observation_digest":"sha256:2a851c4341f89158f78433a2b98970e01d3a2c3377d2f9b70035d61d77cde8c3","observation_id":"ef74e4a7-f24d-426e-a99e-21cdeb40f1fb","resolution":{"observed_at":"2026-07-13T13:07:00.928770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-07-12T23:17:30.297545Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T11:49:49.787123Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:8a2c2e1ef5ec65aa6dad422f0e8f7fd1ed58b0b7bc2bc869ced0cfe9fb929c17","observation_id":"58cf521f-8294-41cc-9335-9906260b1043","resolution":{"observed_at":"2026-05-11T19:31:08.240882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-12T18:26:05.728364Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-07-12T23:17:30.297545Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T18:26:05.728364Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:c2d9d6d20853e4b14ac11859983460de98caa6b603ba60d6ad539f7e18f8795a","observation_id":"346494fb-6aff-40b1-af21-3c6719f9c40d","resolution":{"observed_at":"2026-07-12T18:26:05.728364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2605.09867","last_updated":"2026-05-11T01:51:05Z","snapshot_observed_at":"2026-08-11T06:08:25.918081Z","submitted_at":"2026-05-11T01:51:05Z","title":"Continuous Latent Contexts Enable Efficient Online Learning in Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T05:06:54.598357Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2605.09867"},"observation_digest":"sha256:3f51ce0e794aba04c40875a7a71a09c5c05e51769e42fed2429359a98a3b6d39","observation_id":"0f6a387a-5972-444b-ad9e-d0e0bd7ea9f1","resolution":{"observed_at":"2026-05-12T05:41:23.574147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2606.00183","last_updated":"2026-05-29T14:58:03Z","snapshot_observed_at":"2026-07-06T23:40:56.510371Z","submitted_at":"2026-05-29T14:58:03Z","title":"Agentic Transformers Provably Learn to Search via Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T23:26:28.158991Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2606.00183"},"observation_digest":"sha256:65107281abbff0db1ba4fb5597e1e3df255f02bd880ef301d7f301f02c044102","observation_id":"cb428005-a4ad-4090-8f1a-d89ede65f0a7","resolution":{"observed_at":"2026-06-28T23:42:49.947749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2606.01532","last_updated":"2026-06-02T03:44:54Z","snapshot_observed_at":"2026-08-05T19:46:58.020708Z","submitted_at":"2026-06-01T01:28:42Z","title":"Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T15:48:48.046003Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2606.01532"},"observation_digest":"sha256:f15e5ebadc41d2d0dfb3aba971e5eea192ab62d907b393267a53fc59a83fdd72","observation_id":"4b62c3fd-4b9e-4246-80fe-07705c18a1f7","resolution":{"observed_at":"2026-07-01T22:06:16.212640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-01T21:31:00.903239Z","title":"arXiv preprint arXiv:2412.02975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16072","last_updated":"2026-07-17T15:56:52Z","snapshot_observed_at":"2026-08-10T18:28:02.253272Z","submitted_at":"2026-07-17T15:56:52Z","title":"Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T21:31:00.903239Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2607.16072"},"observation_digest":"sha256:cea4257e289f86a1b443a28d3f64f048d4c461f51bcbe06ebe709acac67a99bf","observation_id":"8bfa3f70-6a48-42be-9ed7-5e34a0907aa8","resolution":{"observed_at":"2026-08-01T21:31:00.903239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-01T20:54:05.553053Z","title":"arXiv preprint arXiv:2412.02975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16528","last_updated":"2026-07-17T22:09:01Z","snapshot_observed_at":"2026-08-07T07:19:10.753414Z","submitted_at":"2026-07-17T22:09:01Z","title":"Hierarchical Domain Generalization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T20:54:05.553053Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2607.16528"},"observation_digest":"sha256:4601e60f727daefc013cc3199ac71693b5419e57f62c568561f2ad983050ee28","observation_id":"d52774c1-9cf4-4ffe-bffc-6140e67f8c26","resolution":{"observed_at":"2026-08-01T20:54:05.553053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-08T00:18:21.263783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.263783Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:d6c29f6f1f010cba950b99ae2874326ab6c943a244064687aab6b8c0ca82f9f8","observation_id":"2b3d7df0-27b4-4bd4-bce4-d824ce19a4e0","resolution":{"observed_at":"2026-08-08T00:18:21.263783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02975/citation-record","integrity":"/paper/2412.02975/integrity","json":"/paper/2412.02975/citation-record.json","paper":"/paper/2412.02975"},"outbound":[],"paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2412.02975."}