{"as_of":"2026-08-10T02:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6778f62a20ba7a3a1a8b4151f141194ddecb146476dee38ea4c01e53c96e162c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:57:22.908318Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:15:07.096284Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:56:47.880747Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2508.00901","last_updated":"2026-05-18T13:04:24Z","snapshot_observed_at":"2026-08-02T13:13:12.421550Z","submitted_at":"2025-07-28T17:24:57Z","title":"Provable Knowledge Acquisition and Extraction in One-Layer Transformers","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T23:05:56.687644Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2508.00901"},"observation_digest":"sha256:87fec600532ff3c99d82b72b285d12b8764a251147c57e2db58d9e08226b3fb2","observation_id":"1a7b7cd7-c4d6-4a78-9f4e-10c11430db8b","resolution":{"observed_at":"2026-05-21T23:10:44.852070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-08-05T13:15:07.096284Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00925","last_updated":"2025-08-31T16:21:21Z","snapshot_observed_at":"2026-08-09T03:34:12.846656Z","submitted_at":"2025-08-31T16:21:21Z","title":"DTRNet: Dynamic Token Routing Network to Reduce Quadratic Costs in Transformers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:15:07.096284Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2509.00925"},"observation_digest":"sha256:57482ea64683eee3033f4550dae55767d5d66040da73644bb8a9cebd3270361e","observation_id":"25956d3d-2ece-4dbc-bcf9-d6d2a8a4b5f6","resolution":{"observed_at":"2026-08-05T13:15:07.096284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2512.12744","last_updated":"2026-05-21T01:18:21Z","snapshot_observed_at":"2026-08-07T14:28:26.092742Z","submitted_at":"2025-12-14T15:47:40Z","title":"Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T22:19:25.483640Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2512.12744"},"observation_digest":"sha256:6b5e1ffc59736fb3ab8da90bf7c174c1e3ee2af6a9a45f4d62d94cac3777eb0e","observation_id":"b9087432-cd4e-42a1-8b5b-3fa872b1f2c0","resolution":{"observed_at":"2026-05-16T22:21:19.053632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2512.12744","last_updated":"2026-05-21T01:18:21Z","snapshot_observed_at":"2026-08-07T14:28:26.092742Z","submitted_at":"2025-12-14T15:47:40Z","title":"Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T11:54:29.436149Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2512.12744"},"observation_digest":"sha256:2d482e76dc1ed1424f148463a0a2d5cb0289275c3c0f627d3a1e258a97ceef26","observation_id":"5cd2c773-03ed-4a2b-a62c-a709c6b164d2","resolution":{"observed_at":"2026-05-22T11:54:51.174733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-08-03T06:55:10.047706Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer.arXiv preprint arXiv:2506.01115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21725","last_updated":"2026-05-27T19:52:53Z","snapshot_observed_at":"2026-08-04T21:23:57.701786Z","submitted_at":"2026-01-29T13:48:43Z","title":"Procedural Pretraining: Warming Up Language Models with Abstract Data","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:55:10.047706Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2601.21725"},"observation_digest":"sha256:53d177aaf594cae4ce2d118f127c4a87f461cb72c4b2be57aeb056977910537c","observation_id":"2ef29a84-3c61-4c99-a577-712726e622bb","resolution":{"observed_at":"2026-08-03T06:55:10.047706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2604.27914","last_updated":"2026-04-30T14:20:16Z","snapshot_observed_at":"2026-08-08T17:04:25.854515Z","submitted_at":"2026-04-30T14:20:16Z","title":"Geometry-Calibrated Conformal Abstention for Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T05:56:03.031192Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2604.27914"},"observation_digest":"sha256:d38bb90b0fe2d00fb1195bf0526ad755c52768c9ffe1482902528f69cfcea4a8","observation_id":"5c3d438d-9afd-463d-93e2-61c7f1e8720e","resolution":{"observed_at":"2026-05-12T10:31:28.657564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.05686","last_updated":"2026-07-14T01:23:51Z","snapshot_observed_at":"2026-08-08T12:25:46.137632Z","submitted_at":"2026-05-07T05:25:54Z","title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T11:47:41.717389Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.05686"},"observation_digest":"sha256:505c6a3e240b97deff2ae318ba0968eb1e15f344ca9f5908a50289259071fa21","observation_id":"3103343d-d627-4c1d-b9a7-94dba112716b","resolution":{"observed_at":"2026-05-11T19:31:08.807728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.05686","last_updated":"2026-07-14T01:23:51Z","snapshot_observed_at":"2026-08-08T12:25:46.137632Z","submitted_at":"2026-05-07T05:25:54Z","title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T07:15:02.755541Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.05686"},"observation_digest":"sha256:29e55900bd72ec8b39b83f1d71397ad64de5e1ee03249e804eb528dc5bb6bd27","observation_id":"b314efdc-8adb-44b0-8ae0-3031b2ecdab7","resolution":{"observed_at":"2026-05-15T07:15:11.538789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-15T11:17:06.440358Z","title":"Attention retrieves, MLP memorizes: Disentangling trainable components in the transformer.CoRR, abs/2506.01115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.05686","last_updated":"2026-07-14T01:23:51Z","snapshot_observed_at":"2026-08-08T12:25:46.137632Z","submitted_at":"2026-05-07T05:25:54Z","title":"Attractor Geometry of Transformer Memory: From Conflict Arbitration to Confident Hallucination","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T11:17:06.440358Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.05686"},"observation_digest":"sha256:35e87eb8b1a8e9df02aa7c3a5232348c93459028a2c2d253706e7eef2a9454a0","observation_id":"20037440-1bb0-4963-9551-f74d7b62b213","resolution":{"observed_at":"2026-07-15T11:17:06.440358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2605.31423","last_updated":"2026-05-29T15:22:06Z","snapshot_observed_at":"2026-08-04T04:10:46.111760Z","submitted_at":"2026-05-29T15:22:06Z","title":"Fixed Universal Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:24:18.984754Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2605.31423"},"observation_digest":"sha256:69a6fc04d7a8d0ac7d6bf0b475f83cddbf646fc8193edb141dfde0e2b48ddfea","observation_id":"028dea82-b222-470e-bee6-0ef6955c05fe","resolution":{"observed_at":"2026-06-29T00:02:50.217756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"cited_work":{"arxiv_id":"2506.01115","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01115","snapshot_observed_at":"2026-07-02T07:56:47.880747Z","title":"Attention retrieves, mlp memorizes: Disentangling trainable components in the transformer","venue":null,"work_id":"35ca95c4-f014-4f2d-9c11-2aecc2e3ec9c","year":2025},"citing_paper":{"arxiv_id":"2606.05134","last_updated":"2026-06-03T17:39:29Z","snapshot_observed_at":"2026-08-07T13:41:23.080938Z","submitted_at":"2026-06-03T17:39:29Z","title":"Activation-Based Active Learning for In-Context Learning: Challenges and Insights","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T06:27:29.827899Z"},"links":{"cited_paper":"/paper/2506.01115","citing_paper":"/paper/2606.05134"},"observation_digest":"sha256:4e119f306d9fc5c319a9f9fcecd8b0b34846939488162725ca66ee49398c7af9","observation_id":"8dbf2c27-2496-441f-bdef-32e954d60dcf","resolution":{"observed_at":"2026-07-02T07:56:47.882218Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01115/citation-record","integrity":"/paper/2506.01115/integrity","json":"/paper/2506.01115/citation-record.json","paper":"/paper/2506.01115"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.05405","last_updated":"2024-04-08T11:11:31Z","snapshot_observed_at":"2026-08-05T03:30:28.158531Z","submitted_at":"2024-04-08T11:11:31Z","title":"Physics of Language Models: Part 3.3, Knowledge Capacity Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05405","snapshot_observed_at":"2026-08-07T11:57:22.571092Z","title":"Physics of language models: Part 3.3, knowledge capacity scaling laws","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.571092Z"},"links":{"cited_paper":"/paper/2404.05405","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:8eadeb10d2e8df0a744daca4ab73d709bfed12192f4bc9079022b136b5eed7a8","observation_id":"8363ba87-329c-42c9-9ecc-0a23659bea68","resolution":{"observed_at":"2026-08-07T11:57:22.571092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14019","last_updated":"2023-02-23T14:54:05Z","snapshot_observed_at":"2026-08-05T19:16:46.142873Z","submitted_at":"2022-10-25T13:41:31Z","title":"The Curious Case of Benign Memorization","version":3},"cited_work":{"arxiv_id":"2210.14019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.14019","snapshot_observed_at":"2026-08-07T11:57:23.697420Z","title":"The Curious Case of Benign Memorization","venue":"cs.LG","work_id":"f5c683d1-89bd-42ac-9a1d-697f6f69102c","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.577524Z"},"links":{"cited_paper":"/paper/2210.14019","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:bd9839c9c808e6c690bfa91350b3c5582982cbacbdb1261b97fcea4b4f340b62","observation_id":"e9abca2d-5c2b-440f-9692-f09073b1fa79","resolution":{"observed_at":"2026-08-07T11:57:23.702593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.153753Z","title":"Du, Wei Hu, Zhiyuan Li, Ruslan Salakhutdinov, and Ruosong Wang.On exact computation with an infinitely wide neural net","venue":null,"work_id":"d19cfcca-40ae-4e7f-8baa-43bfaa3a79c2","year":2019},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.583250Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:80dde6b3040922036c22d682851c075701d7e7a39e3ce76028e96863eab14eb6","observation_id":"73175888-b0e0-4f1b-a063-df84c3ac5ce3","resolution":{"observed_at":"2026-08-07T11:57:24.158136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.137789Z","title":"A closer look at memorization in deep networks","venue":null,"work_id":"71c7d1eb-7674-43db-bd69-230dff1f5047","year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.588325Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:ca144278b944a2dbb2ea8e378846c940f470d72fb491c19706496aeaa1097134","observation_id":"e41ea57a-c370-4585-bf0c-5511b8b9b17a","resolution":{"observed_at":"2026-08-07T11:57:24.143410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.117662Z","title":"Scaling mlps: A tale of inductive bias","venue":null,"work_id":"3e44bde6-b809-4f9a-884f-00a692da34f5","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.593277Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:d8e2c098157e76acb103b6682fe3079f7e9ab5d74a45b96b7393da5f653c07f0","observation_id":"117151e8-5cca-4bda-b64b-6e54be0079b1","resolution":{"observed_at":"2026-08-07T11:57:24.123851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.599011Z","title":"Mechanistic interpretability for AI safety - a review.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.599011Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:d71a28372a5e70a410f09a59ee7629272ad4c5034f6247937d1a158b167fd3c2","observation_id":"879bb15d-bee3-410b-a93f-0189690761f1","resolution":{"observed_at":"2026-08-07T11:57:22.599011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.091883Z","title":"Birth of a transformer: A memory viewpoint.Advances in Neural Information Processing Systems, 36:1560–1588, 2023","venue":null,"work_id":"7b3fa38c-d86f-4dc2-8e3f-b472664017a8","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.605192Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:605b684738e8ab82269c7ceb99dd3cc04e74f4ff0e8dc1c831fee87b5cba93d1","observation_id":"0ea2cbf4-4bb5-4b85-af8e-f660e06859a4","resolution":{"observed_at":"2026-08-07T11:57:24.096487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10735","last_updated":"2025-04-17T12:53:23Z","snapshot_observed_at":"2026-08-07T16:05:43.591788Z","submitted_at":"2025-04-14T22:06:24Z","title":"Frozen Layers: Memory-efficient Many-fidelity Hyperparameter Optimization","version":2},"cited_work":{"arxiv_id":"2504.10735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10735","snapshot_observed_at":"2026-08-07T11:57:23.523173Z","title":"Frozen Layers: Memory-efficient Many-fidelity Hyperparameter Optimization","venue":"cs.LG","work_id":"bc86d0b6-352c-4e46-a000-3d103cf90a2f","year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.611391Z"},"links":{"cited_paper":"/paper/2504.10735","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:9e0081158abc67c69419f661b7519afc8766abd49a335e5041d5a3492f2dd0c6","observation_id":"662cb06e-280c-496c-b623-4dc346d22452","resolution":{"observed_at":"2026-08-07T11:57:23.631525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05675","last_updated":"2022-10-13T14:06:09Z","snapshot_observed_at":"2026-08-06T08:59:00.500125Z","submitted_at":"2022-10-11T09:29:19Z","title":"Transformers generalize differently from information stored in context vs in weights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05675","snapshot_observed_at":"2026-08-07T11:57:22.619625Z","title":"Transformers generalize differently from information stored in context vs in weights.arXiv preprint arXiv:2210.05675, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.619625Z"},"links":{"cited_paper":"/paper/2210.05675","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:010b3e40f9db6b01c3cd66191c533694cb0bd3154182432e678b010135ec053c","observation_id":"3191c054-6843-42be-a1a1-84be8dbd1f98","resolution":{"observed_at":"2026-08-07T11:57:22.619625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.077646Z","title":"Distributional associations vs in-context reasoning: A study of feed-forward and attention layers.ICLR, 2024","venue":null,"work_id":"49952b80-d0d0-44ee-90d3-f198cd4a31ee","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.626924Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:83860c1a58791ead61b384ce405cdf684a591124f187e028947303256063025c","observation_id":"30c7a563-58a0-4209-ae7e-594a24231996","resolution":{"observed_at":"2026-08-07T11:57:24.082310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.063936Z","title":"Knowledge localization: Mission not accomplished? enter query localization! InProceedings of the Thirteenth International Conference on Learning Representations (ICLR), 2025","venue":null,"work_id":"7b6feb02-b74a-4511-99b2-10564fec711e","year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.633098Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:8b975f07c1db5d95d3e595c3ef3689f7a889020908ba14cc1c5f041840d257b3","observation_id":"68fa1850-9619-4b11-837e-0cf11690ca00","resolution":{"observed_at":"2026-08-07T11:57:24.068319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.049984Z","title":"Summing up the facts: Additive mechanisms behind factual recall in llms, 2024","venue":null,"work_id":"3132c393-201d-4817-9109-4af4fd628536","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.639502Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:d6213151492fe4ae50c779e06ddbf1abdd9c4af1fc465a6d2d05343db57234e6","observation_id":"8ca9d54d-76bd-4019-af87-fba6bb10bc3e","resolution":{"observed_at":"2026-08-07T11:57:24.054015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.036407Z","title":"Induction heads as an essential mechanism for pattern matching in in-context learning","venue":null,"work_id":"228eb341-419a-4bb9-99dd-6a408ed836bc","year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.647499Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:77a7449394ebc5a729eaa7413e2992d7dd06e73482164284f8c4ae23502a4ff0","observation_id":"1e846ff2-6ed8-4deb-8034-b1fb20869d90","resolution":{"observed_at":"2026-08-07T11:57:24.040339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.655162Z","title":"Knowledge neurons in pretrained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.655162Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:3286cce7bbe10bc2a2dcf4c37180b41f6555448bed078574861a24dfd31bf954","observation_id":"83408a97-f0ab-447b-a5e6-c01f0c6a15c1","resolution":{"observed_at":"2026-08-07T11:57:22.655162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.021866Z","title":"Attention is not all you need: Pure attention loses rank doubly exponentially with depth","venue":null,"work_id":"8bc114b8-c949-4432-a5a1-06c265675962","year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.661558Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:d3e2abf298ce89eb9a7d8effc8153438945534126566514839dc30247cee775a","observation_id":"44cc6a85-ddda-418d-9e36-2645fb4adb39","resolution":{"observed_at":"2026-08-07T11:57:24.027077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:57:22.667162Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.667162Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:53cfcb224919134cb2c87427501550f78da64be9b3101f65246acb22a728bfc0","observation_id":"28cc1dae-114a-43c7-a596-2b6d94072207","resolution":{"observed_at":"2026-08-07T11:57:22.667162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:24.003372Z","title":"Edelman, eran malach, and Surbhi Goel","venue":null,"work_id":"0e2bf7cf-731b-4df6-9a21-ceeddb837410","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.672227Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:a3e184b498a6957fa66efaa1794dd1ac13a030bde917a9b26bc4c93503e3b490","observation_id":"1d511882-7077-4c50-b2ab-5aa70f144bfa","resolution":{"observed_at":"2026-08-07T11:57:24.008710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.984804Z","title":"A mathematical framework for transformer circuits.Transformer Circuits Thread, 2021","venue":null,"work_id":"087f3a1e-2b27-4ee8-b3a6-62910f52d4b8","year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.677623Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:1565a7d71b00680d0e92aaa62174e3aeae8c80d7c3995c393daca742dd186e2a","observation_id":"6de929e4-298d-4f9f-bd46-dcf17694bbd6","resolution":{"observed_at":"2026-08-07T11:57:23.989975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-07T23:50:29.977330Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-07T11:57:22.682505Z","title":"Transformer feed-forward layers are key-value memories.arXiv preprint arXiv:2012.14913, 2020","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.682505Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:29e8f403b6edf72852c13b08f5f2f7de723f196dc5dd4caa53ba121b593c0e96","observation_id":"58bf9a70-406d-4f25-8238-7eedfc9358da","resolution":{"observed_at":"2026-08-07T11:57:22.682505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.687732Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.687732Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:6a1f5e620aa8b4c345969e7832f9b6119aecf94d71a2dc0c2e519ecb86ae0423","observation_id":"c47962c0-f560-41db-b6ee-fa5f74c6d609","resolution":{"observed_at":"2026-08-07T11:57:22.687732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.692163Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.692163Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:cf265f636f744c49d1c4893d4ec97126626fa5800248bb6b7debf063b973440f","observation_id":"c0f87075-542c-4a28-afc8-718b2ecba1d3","resolution":{"observed_at":"2026-08-07T11:57:22.692163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.696572Z","title":"Dissectingrecalloffactualassociations inauto-regressivelanguagemodels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.696572Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:386ef83983483200ce489d35bbcfe3ab2bdbb94bba30cb8c2d3fdc379d51a806","observation_id":"2dc95dbb-4299-4414-a852-483b5d696015","resolution":{"observed_at":"2026-08-07T11:57:22.696572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:57:22.701367Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.701367Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:cb7b3d6c60c032cdb98bd1a8ce744e43f42a127ccc5f00fa8df6381361530049","observation_id":"a3e0fa06-aee0-48fa-b920-79811df9a4f2","resolution":{"observed_at":"2026-08-07T11:57:22.701367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.969877Z","title":"Smith, and Roy Schwartz","venue":null,"work_id":"a93a9465-0d1d-4f4b-8434-d43f33603aab","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.705870Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:fce8fc74da90a1c8410ac4253e6d3dfa0c8b799d17cd3035839aec40cd8fba81","observation_id":"9631f467-18cd-46a7-aa33-fb364dfc04cf","resolution":{"observed_at":"2026-08-07T11:57:23.974388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01906","last_updated":"2024-05-31T11:14:16Z","snapshot_observed_at":"2026-07-06T16:42:40.074343Z","submitted_at":"2023-11-03T13:30:52Z","title":"Simplifying Transformer Blocks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01906","snapshot_observed_at":"2026-08-07T11:57:22.710780Z","title":"Simplifying transformer blocks.arXiv preprint arXiv:2311.01906, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.710780Z"},"links":{"cited_paper":"/paper/2311.01906","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:fd63527522461242868c5d4b960bd6fd189a74e04b6b3721468d43de95d4ed40","observation_id":"2849f7ac-531f-4d2e-9980-80ffde91facd","resolution":{"observed_at":"2026-08-07T11:57:22.710780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12786","last_updated":"2024-08-21T16:37:20Z","snapshot_observed_at":"2026-07-06T16:50:42.754354Z","submitted_at":"2023-11-21T18:51:04Z","title":"Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12786","snapshot_observed_at":"2026-08-07T11:57:22.716704Z","title":"Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks.arXiv preprint arXiv:2311.12786, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.716704Z"},"links":{"cited_paper":"/paper/2311.12786","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:545fd554a3add40c5f1bd9f7fc622bc6964e8b509cb1f09809d187be334bd269","observation_id":"20848180-274a-4d69-a981-68c6b2675f35","resolution":{"observed_at":"2026-08-07T11:57:22.716704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.722380Z","title":"What is the best multi-stage architecture for object recognition? In2009 IEEE 12th International Conference on Computer Vision, pages 2146–2153, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.722380Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:b12adfeff3da4f9252afaf195cec0656857eed4180161da5219da0c2085a4f3b","observation_id":"547444a1-677d-4f56-a61f-815b88a3eef3","resolution":{"observed_at":"2026-08-07T11:57:22.722380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.956063Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries, 2024","venue":null,"work_id":"8cbd1e8d-9b5f-462f-991f-5c9eb7c8b031","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.728573Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:7961ca04e3b531be34b6758c2a2310641be337373aad54851fdbeafa5b39fe4a","observation_id":"657d772e-82b4-4721-82b6-807cdc2c3692","resolution":{"observed_at":"2026-08-07T11:57:23.960220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00165","last_updated":"2018-03-03T00:45:00Z","snapshot_observed_at":"2026-08-04T10:06:19.819372Z","submitted_at":"2017-11-01T02:13:25Z","title":"Deep Neural Networks as Gaussian Processes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00165","snapshot_observed_at":"2026-08-07T11:57:22.735092Z","title":"Deep neural networks as gaussian processes.arXiv preprint arXiv:1711.00165, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.735092Z"},"links":{"cited_paper":"/paper/1711.00165","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:01a7794fa23c91a672753b8b0fbae6fd5d879d27a9555aea6220c8c398ea0ed4","observation_id":"1487f04a-6d72-4d38-87fd-03cc49bd03a7","resolution":{"observed_at":"2026-08-07T11:57:22.735092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03824","last_updated":"2022-05-26T18:50:20Z","snapshot_observed_at":"2026-08-03T17:35:52.520891Z","submitted_at":"2021-05-09T03:32:48Z","title":"FNet: Mixing Tokens with Fourier Transforms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03824","snapshot_observed_at":"2026-08-07T11:57:22.740900Z","title":"Fnet: Mixing tokens with fourier transforms","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.740900Z"},"links":{"cited_paper":"/paper/2105.03824","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:b2faae42e17dd1afee0413ba8e136888d7be3c4830134d3ead86ecdd257c285a","observation_id":"712c06fc-030a-4711-a0f1-dbb80d30ae53","resolution":{"observed_at":"2026-08-07T11:57:22.740900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.940942Z","title":"The neural covariance sde: Shaped infinite depth-and-width networks at initialization.Advances in Neural Information Processing Systems, 35:10795–10808, 2022","venue":null,"work_id":"f972cb0c-cdd9-4f72-ba7b-6cee810a9303","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.745978Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:88c4cf0a5b5412284eae358710ca2f696609e6269dcb39c16d32765035600510","observation_id":"5c2b73b7-af45-463d-9a16-cae3f6618d03","resolution":{"observed_at":"2026-08-07T11:57:23.946050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01765","last_updated":"2021-10-05T00:49:36Z","snapshot_observed_at":"2026-08-04T07:37:13.014261Z","submitted_at":"2021-10-05T00:49:36Z","title":"Rapid training of deep neural networks without skip connections or normalization layers using Deep Kernel Shaping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.01765","snapshot_observed_at":"2026-08-07T11:57:22.750524Z","title":"Rapid training of deep neural networks without skip connections or normalization layers using deep kernel shaping.arXiv preprint arXiv:2110.01765, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.750524Z"},"links":{"cited_paper":"/paper/2110.01765","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:e9e0493bcc79722ff18a91cc0af40c8d999b768b0e15065e672b9be2a4128d28","observation_id":"59b06326-5916-47b7-9a17-d49c8b382d79","resolution":{"observed_at":"2026-08-07T11:57:22.750524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-07T11:57:22.755732Z","title":"Locating and editing factual knowledge in gpt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.755732Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:ba39c2e4fdc301f404872bfea4358906b884ce1808ca7de7fa78f719323eeff7","observation_id":"f8d18586-9ccc-4f75-92cb-096e3db23870","resolution":{"observed_at":"2026-08-07T11:57:22.755732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T11:57:22.760917Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.760917Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:f37c8ebde10124364b9192097fa6217065314a768833c39e1b2c928116cf1dc2","observation_id":"a0aca01b-a1f7-4fd7-a5da-eabfdb3d31f5","resolution":{"observed_at":"2026-08-07T11:57:22.760917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.922524Z","title":"Language models implement simple word2vec-style vector arithmetic, 2024","venue":null,"work_id":"c5b1785a-7842-46a7-8e1c-c3e3925ef208","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.765913Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:fa802806018268c3ef8146708d54d18d9e495bc103fc729f2a46abd4249455eb","observation_id":"1565742c-8d44-47e6-a5d7-46ce1da0bc03","resolution":{"observed_at":"2026-08-07T11:57:23.927859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.901841Z","title":"Universal approximation property of random neural networks","venue":null,"work_id":"8e21356f-fd9c-48d7-9063-31f4d19a80c4","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.771350Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:4497f1f670c4e4451f443ae069810df9feb39786530e6be224351f3e05e96798","observation_id":"80ff018a-334f-4a56-abb3-99e13bcdbd6a","resolution":{"observed_at":"2026-08-07T11:57:23.911077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.775855Z","title":"Signal propagation in transformers: Theoretical perspectives and the role of rank collapse.Advances in Neural Information Processing Systems, 35:27198–27211, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.775855Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:6fa1c357ff53c92c31e38beaec8a50476a84abfdd1336604c01b811dc5b8a561","observation_id":"21a9c1d6-595c-4cb0-9df0-32949282d797","resolution":{"observed_at":"2026-08-07T11:57:22.775855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.875386Z","title":"The shaped transformer: Attention models in the infinite depth-and-width limit.Advances in Neural Information Processing Systems, 36:54250–54281, 2023","venue":null,"work_id":"2a1193c6-abec-4614-a430-e039c0efd359","year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.780004Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:b78480fe316ad4dbce7b1a303287064803615a59ce5a0b848f7dcd453e0e0632","observation_id":"2d5c8a7b-2e2e-4611-8957-ff5225150e0b","resolution":{"observed_at":"2026-08-07T11:57:23.880239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.13019","last_updated":"2021-04-12T19:58:27Z","snapshot_observed_at":"2026-08-09T05:52:46.908286Z","submitted_at":"2021-02-25T17:22:53Z","title":"Investigating the Limitations of Transformers with Simple Arithmetic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.13019","snapshot_observed_at":"2026-08-07T11:57:22.784025Z","title":"Investigating the limitations of transformers with simple arithmetic tasks.arXiv preprint arXiv:2102.13019, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.784025Z"},"links":{"cited_paper":"/paper/2102.13019","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:e01344d1a49b7eeee01783da7be95d2a49c47ce2b28280310c8b19ef6c9e1fa9","observation_id":"dbacfc98-69da-4b05-ac89-594e5b700859","resolution":{"observed_at":"2026-08-07T11:57:22.784025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-07T11:57:22.788567Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.788567Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:f99a8229156f7b651a3bd8cf633f464eb56a23c20a92eade405067b7cd8df0b3","observation_id":"0211457a-d6c4-426d-b890-b1f416dfa5b7","resolution":{"observed_at":"2026-08-07T11:57:22.788567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T11:57:22.793335Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.793335Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:48b92c6bb8929bde2376f21e23367ef824b49d066fe8d43717f7df8444419298","observation_id":"6a25774c-81d1-49bd-bc77-47473673ab53","resolution":{"observed_at":"2026-08-07T11:57:22.793335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17844","last_updated":"2024-08-19T17:26:18Z","snapshot_observed_at":"2026-08-09T14:35:48.289765Z","submitted_at":"2024-03-26T16:33:12Z","title":"Mechanistic Design and Scaling of Hybrid Architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17844","snapshot_observed_at":"2026-08-07T11:57:22.798604Z","title":"Mechanistic design and scaling of hybrid architectures","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.798604Z"},"links":{"cited_paper":"/paper/2403.17844","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:05c01a7485c9a40bae78e794a5a3e50608f2faee228c32c919e73f1091a32812","observation_id":"7dcd428a-9b5d-4e5f-987c-30bbdeab8320","resolution":{"observed_at":"2026-08-07T11:57:22.798604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.804007Z","title":"Exponential expressivity in deep neural networks through transient chaos.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.804007Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:ee57be00baf7f340712208ba88083a4c297e7bf79f2da04daf3b9a6eaf16a09a","observation_id":"021dc086-0b6c-4db4-8065-c4b2caa7fd2e","resolution":{"observed_at":"2026-08-07T11:57:22.804007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12997","last_updated":"2024-02-05T23:29:12Z","snapshot_observed_at":"2026-08-09T10:43:24.211063Z","submitted_at":"2023-11-21T21:16:54Z","title":"Compositional Capabilities of Autoregressive Transformers: A Study on Synthetic, Interpretable Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12997","snapshot_observed_at":"2026-08-07T11:57:22.808829Z","title":"Compositional capabilities of autoregressive transformers: A study on synthetic, interpretable tasks.arXiv preprint arXiv:2311.12997, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.808829Z"},"links":{"cited_paper":"/paper/2311.12997","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:99de8bf833198240c4b8f789da9397d5e292e0d39b479ff5d341a4c1ab0cf6b6","observation_id":"5569d08c-f9ac-48ce-88af-7ae4d248fd97","resolution":{"observed_at":"2026-08-07T11:57:22.808829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09268","last_updated":"2024-02-14T15:54:55Z","snapshot_observed_at":"2026-07-06T17:30:03.953345Z","submitted_at":"2024-02-14T15:54:55Z","title":"Transformers, parallel computation, and logarithmic depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09268","snapshot_observed_at":"2026-08-07T11:57:22.814818Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.814818Z"},"links":{"cited_paper":"/paper/2402.09268","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:efd7fb62000f840ea2a193691636037e63d15c0ddf05e2d479b0d9b849145a4f","observation_id":"dd623bde-0640-418a-83e6-52d2867d6da9","resolution":{"observed_at":"2026-08-07T11:57:22.814818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.849921Z","title":"Saxe, Pang Wei Koh, Zhenghao Chen, Maneesh Bhand, Bipin Suresh, and Andrew Y","venue":null,"work_id":"e4735a2d-116b-4de0-b54f-4c5a64c03d09","year":2011},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.819921Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:32143ab85ce787f0f01157189109cda279492388c3ca847048a4aa0e6faa3c0f","observation_id":"11d2c10c-c4bd-4ca0-97d0-bf2ca5d19531","resolution":{"observed_at":"2026-08-07T11:57:23.855012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01232","last_updated":"2017-04-04T19:36:14Z","snapshot_observed_at":"2026-07-06T05:17:20.642708Z","submitted_at":"2016-11-04T00:44:32Z","title":"Deep Information Propagation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01232","snapshot_observed_at":"2026-08-07T11:57:22.825593Z","title":"Deep information propagation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.825593Z"},"links":{"cited_paper":"/paper/1611.01232","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2da4648c7f022fd116d1374b44f1b253e8ec972b203d0d60d7c6bf2589be7c89","observation_id":"4aaf9a34-45f3-46e3-bf4c-199425e2134a","resolution":{"observed_at":"2026-08-07T11:57:22.825593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.830990Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.830990Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:0d85a8e79298c931761179bc248ff01935ee1e9d5e4d811c20857ec231f25c1c","observation_id":"3eaae48b-ba2b-486d-a579-8517c8271da9","resolution":{"observed_at":"2026-08-07T11:57:22.830990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.822504Z","title":"Synthesizer: Rethinking self-attention in transformer models","venue":null,"work_id":"4164c214-b52b-413f-a239-cd8726d39d15","year":2021},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.836163Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:2b30a4e92bbfeca00da7279f57f5bc676a3131dba2b46f97ffe84f4036601ba3","observation_id":"a6875d19-b787-4d3f-a7f3-4611c9930bcd","resolution":{"observed_at":"2026-08-07T11:57:23.827631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-08-05T21:57:04.021766Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-08-07T11:57:22.842653Z","title":"Efficient transformers: A survey, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.842653Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:4800a42c5b81c923c59da0f59efb8db9f1a83cf9b9ccf2c9138f5da4dfa6f341","observation_id":"63bf97f3-c7f4-429d-99be-880d433f5eb0","resolution":{"observed_at":"2026-08-07T11:57:22.842653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:57:22.848934Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.848934Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:8d3e4f538466aad7dd9d16747bc69136fa0835e567522bdc25b3bef5b4245b8d","observation_id":"b34f8d58-6c3e-4c0d-99b8-b42f47b9359d","resolution":{"observed_at":"2026-08-07T11:57:22.848934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T11:57:22.853190Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.853190Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:552bd06eccc227220538be2c00e87776d3ec5fee2aa754ec8e032c171dda529a","observation_id":"0d52af51-62e5-487e-b502-cf2f62f01f67","resolution":{"observed_at":"2026-08-07T11:57:22.853190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.858670Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.858670Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:939e837c32d772827b5e655bad65439e69edd4f8f5a9f6e433ddcc4d91012ae6","observation_id":"dc020708-d608-41be-92e3-0f469d4e5e57","resolution":{"observed_at":"2026-08-07T11:57:22.858670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.862990Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.862990Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:0fb17909cb90b7a27e3176059d2d86663ee0e83150874cb5e23174a29f1454e4","observation_id":"d3defb31-0d36-4736-8d53-77758ef0d9be","resolution":{"observed_at":"2026-08-07T11:57:22.862990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:22.867299Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.867299Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:fb566ac10ddf3071f355e95e52b38c85a4a742e878b40480f458c787cbdb7d7e","observation_id":"096338b0-aec6-4fa4-8739-8d2059421669","resolution":{"observed_at":"2026-08-07T11:57:22.867299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.778128Z","title":"Mean field residual networks: On the edge of chaos.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"584b6f66-4d2a-4f90-b61e-988a30116582","year":2017},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.872566Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:beee0a17691d0153dc44be53fedb33c29df23331c45c42633241f652b1245282","observation_id":"e41da55c-0d29-4096-a942-585c53b48eb9","resolution":{"observed_at":"2026-08-07T11:57:23.782386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17969","last_updated":"2025-01-03T16:41:37Z","snapshot_observed_at":"2026-08-08T01:27:33.186418Z","submitted_at":"2024-05-28T08:56:33Z","title":"Knowledge Circuits in Pretrained Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17969","snapshot_observed_at":"2026-08-07T11:57:22.877534Z","title":"Knowledge circuits in pretrained transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.877534Z"},"links":{"cited_paper":"/paper/2405.17969","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:6fbc882635dcd11ebf038b5bc4244808df3ff6e6ee2937a38383205e7688399b","observation_id":"62a6dff9-fa4b-41a5-83b7-798521dfa5b2","resolution":{"observed_at":"2026-08-07T11:57:22.877534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.763428Z","title":"Locating factual knowledge in large language models: Exploring the residual stream and analyzing subvalues in vocabulary space, 2024","venue":null,"work_id":"c2214af2-cc19-47c6-9011-a3e70591169e","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.882846Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:99bf6800b5e36ac7a5561b10a7d1b1324fcfb41d6115f1d25a89a3b2e859159d","observation_id":"04f9a6a8-d1a4-4ed3-a4b2-cb39ecf1b7a0","resolution":{"observed_at":"2026-08-07T11:57:23.768403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.749574Z","title":"Are transformers universal approximators of sequence-to-sequence functions? InInternational Conference on Learning Representations, 2020","venue":null,"work_id":"ecca1633-1888-4583-b8b6-a0daa0709cff","year":2020},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.887654Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:5a59d71c10e8a7a0ab83fd41f3a152a7d376ef93f091b0a313739cfe8650db55","observation_id":"56cf4fe1-77de-43a9-a710-6a90ec70ae58","resolution":{"observed_at":"2026-08-07T11:57:23.753867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-07T11:57:22.891916Z","title":"Understanding deep learning requires rethinking generalization.arXiv preprint arXiv:1611.03530, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.891916Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:61030bf41e5e34a2cd9a1250af09f8f25ec5bc528dc7840fab96ef925a8647d4","observation_id":"82e33590-6882-4b6a-9e7f-16ecdf82cd1a","resolution":{"observed_at":"2026-08-07T11:57:22.891916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08120","last_updated":"2022-03-15T17:49:08Z","snapshot_observed_at":"2026-07-06T12:48:13.087800Z","submitted_at":"2022-03-15T17:49:08Z","title":"Deep Learning without Shortcuts: Shaping the Kernel with Tailored Rectifiers","version":1},"cited_work":{"arxiv_id":"2203.08120","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08120","snapshot_observed_at":"2026-08-07T11:57:23.004485Z","title":"Deep Learning without Shortcuts: Shaping the Kernel with Tailored Rectifiers","venue":"cs.LG","work_id":"a82c6d7a-b025-4eff-beda-6afc00bcb681","year":2022},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.896639Z"},"links":{"cited_paper":"/paper/2203.08120","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:cd0f8d3db7318b1a0eb78ac98dd6d0ee06f75f51feb7a785bc192a6d6826b14b","observation_id":"f6072648-2491-47d1-9f03-c2373e9c0d1c","resolution":{"observed_at":"2026-08-07T11:57:23.011772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01626","last_updated":"2016-04-04T02:34:30Z","snapshot_observed_at":"2026-08-07T08:03:58.370822Z","submitted_at":"2015-09-04T22:31:53Z","title":"Character-level Convolutional Networks for Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01626","snapshot_observed_at":"2026-08-07T11:57:22.901611Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.901611Z"},"links":{"cited_paper":"/paper/1509.01626","citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:fddc83c6758664b1692e2fee9a30f483974a63c467565819a889246724abec7f","observation_id":"294b2fae-c881-45c7-a025-2371793ba2e9","resolution":{"observed_at":"2026-08-07T11:57:22.901611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:23.735863Z","title":"Algorithmic capabilities of random transformers","venue":null,"work_id":"5b1026c7-efa6-4abc-b7e0-5d772672d91b","year":2024},"citing_paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:57:22.908318Z"},"links":{"citing_paper":"/paper/2506.01115"},"observation_digest":"sha256:3514bb0cb91b0a2a758dfe836094a8e9189dd1929c9edd8d6598afa75d0ee7d9","observation_id":"8b1f9f34-206f-4e51-ae70-d8265d664326","resolution":{"observed_at":"2026-08-07T11:57:23.740198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01115","last_updated":"2025-09-03T19:18:47Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T11:54:01.449606Z","submitted_at":"2025-06-01T18:42:39Z","title":"Is Random Attention Sufficient for Sequence Modeling? Disentangling Trainable Components in the Transformer"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 11 inbound Pith citation observations for arXiv:2506.01115."}