{"as_of":"2026-08-10T15:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ff8d38c41ea4e4df5762bb85ca7e4fd5e5870de23585364680a96987243941d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:18:21.386846Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04243/citation-record","integrity":"/paper/2608.04243/integrity","json":"/paper/2608.04243/citation-record.json","paper":"/paper/2608.04243"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22840","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.924752Z","title":"A capacity-based rationale for multi-head attention, 2026","venue":null,"work_id":"57fa89cb-877e-4717-9687-b87e15a16de9","year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.246895Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:57db85badbe488278df69d51e2c8216dc94e4d470b4963f0563fd1bf4e2f2bef","observation_id":"beca5942-c7bd-4a69-a1f4-a74eb67ecc8b","resolution":{"observed_at":"2026-08-08T00:18:21.930876Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.128556Z","title":"Online linear optimization and adaptive routing","venue":null,"work_id":"08f79724-dc0c-4eef-a4c1-14aa343b4635","year":2008},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.251607Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:f96f390d550eb2532acd0299ae02dfbd6232ac2c14081dae1b196adfa11450e9","observation_id":"dff403db-43f9-48c3-95ba-d46f7a33e432","resolution":{"observed_at":"2026-08-08T00:18:22.132620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.117179Z","title":"Some extremal postage stamp bases.Journal of Integer Sequences, 13(2):3, 2010","venue":null,"work_id":"2cfa8c58-bb4d-4528-aee1-ae42f7ebb2ea","year":2010},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.255630Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:c932486aefb2c8ae3d3c5581a6ae926c50cf9116c3fab8ae1a1f69f8c3de91eb","observation_id":"37b95261-b3f7-497e-82ab-6f6528edcac0","resolution":{"observed_at":"2026-08-08T00:18:22.121254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.105604Z","title":"Theoretical limitations of multi-layer transformer,","venue":null,"work_id":"501fe4d3-a56b-46fe-9f12-a5b21b3bb38b","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.259710Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:90e2c7656e64dd5c9603ad0522cb390cbdf9d30e300ac360a33f9f8f2b8602ab","observation_id":"91d939f6-4857-40d5-a19e-3a968f32c2ac","resolution":{"observed_at":"2026-08-08T00:18:22.109810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10743","last_updated":"2023-11-13T15:19:02Z","snapshot_observed_at":"2026-08-09T18:05:37.837839Z","submitted_at":"2023-01-25T18:05:55Z","title":"Tighter Bounds on the Expressivity of Transformer Encoders","version":3},"cited_work":{"arxiv_id":"2301.10743","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10743","snapshot_observed_at":"2026-08-08T00:18:21.838745Z","title":"Tighter Bounds on the Expressivity of Transformer Encoders","venue":"cs.LG","work_id":"c3ac68ef-12e8-4c2b-993f-77df20f28133","year":2023},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.268399Z"},"links":{"cited_paper":"/paper/2301.10743","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:27140c98347969b6feb4cdaa1ea838719279c1bd33f645a5fa1007d78cfa561a","observation_id":"9cf18003-55b1-4a52-b4f4-47e9154309bc","resolution":{"observed_at":"2026-08-08T00:18:21.843522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T00:18:21.272654Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.272654Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:d7eca4c197c4606d494994795048e56116bb252a06a597d5da1cfe29c774ae96","observation_id":"c82b1c13-e4ca-4443-b178-b469ed5a78cc","resolution":{"observed_at":"2026-08-08T00:18:21.272654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09434","last_updated":"2021-03-30T04:06:04Z","snapshot_observed_at":"2026-08-09T18:04:10.350930Z","submitted_at":"2020-02-21T17:30:00Z","title":"Few-Shot Learning via Learning the Representation, Provably","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09434","snapshot_observed_at":"2026-08-08T00:18:21.277169Z","title":"Du, Wei Hu, Sham M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.277169Z"},"links":{"cited_paper":"/paper/2002.09434","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:d4130a248d7106a8ac577cfdc6efb15a45b90f14b29cd50cf6a66088df5ba266","observation_id":"7b7015f8-7cdc-48a0-b17e-60dd87d12b1d","resolution":{"observed_at":"2026-08-08T00:18:21.277169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.092768Z","title":"A combinatorial problem in geometry.Compositio Mathematica, 2:463–470, 1935","venue":null,"work_id":"07b68f0c-2445-4c55-a77b-57544aca7a37","year":1935},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.281858Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:b9c2878d7905f0536c892b76527363faaa19b222e89817ebd5d137deb891fe96","observation_id":"f7d4dd3e-54d0-45c9-9e5f-d9eaa98c5cb1","resolution":{"observed_at":"2026-08-08T00:18:22.096681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.285854Z","title":"Theoretical limitations of self-attention in neural sequence models.Transactions of the Association for Computational Linguistics, 8:156–171, December 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.285854Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:8d34145ab430fa027f1c918102ccf7ae08351fca6eea95f24784b9f395e7ade0","observation_id":"f27f124b-e4fe-40d2-bf18-cdfa8703c07d","resolution":{"observed_at":"2026-08-08T00:18:21.285854Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.081308Z","title":"Formal language recognition by hard attention transformers: Perspectives from circuit complexity, 2022","venue":null,"work_id":"c344faa0-3cc6-41ec-b085-2f296d50a5a4","year":2022},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.289984Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:88ed2262d229330c714ee5a0a7c604d812098ba0bdd5771d12f432db211889f8","observation_id":"61a25a05-573c-400f-abd0-ff91a56e996d","resolution":{"observed_at":"2026-08-08T00:18:22.085791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14023","last_updated":"2024-01-29T10:16:41Z","snapshot_observed_at":"2026-08-10T14:19:57.882915Z","submitted_at":"2023-07-26T08:07:37Z","title":"Are Transformers with One Layer Self-Attention Using Low-Rank Weight Matrices Universal Approximators?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14023","snapshot_observed_at":"2026-08-08T00:18:21.293789Z","title":"Are transformers with one layer self-attention using low-rank weight matrices universal approximators?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.293789Z"},"links":{"cited_paper":"/paper/2307.14023","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:c8814576dd03c8331591d71cc4ee2031def44819fa43ed0a6ac545791aa66a27","observation_id":"9f7f622e-23d4-439d-815b-2f3e9dd54550","resolution":{"observed_at":"2026-08-08T00:18:21.293789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20195","last_updated":"2024-12-28T16:09:25Z","snapshot_observed_at":"2026-08-09T19:53:22.429771Z","submitted_at":"2024-12-28T16:09:25Z","title":"Lower bounds on transformers with infinite precision","version":1},"cited_work":{"arxiv_id":"2412.20195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20195","snapshot_observed_at":"2026-08-08T00:18:21.788685Z","title":"Lower bounds on transformers with infinite precision","venue":"cs.LG","work_id":"2fec59f4-3430-4cf7-b642-4eb983d2d803","year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.297935Z"},"links":{"cited_paper":"/paper/2412.20195","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:ba4cf5bb8ce0864cfbe5500ee836a5816aa87efe59b1e0f48bc99d962a589784","observation_id":"49c33eec-0cf9-45d5-a364-6c2c18a18adb","resolution":{"observed_at":"2026-08-08T00:18:21.793091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05896","last_updated":"2026-05-07T02:31:59Z","snapshot_observed_at":"2026-07-06T22:44:42.380489Z","submitted_at":"2026-02-05T17:14:33Z","title":"Parity, Sensitivity, and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05896","snapshot_observed_at":"2026-08-08T00:18:21.302058Z","title":"Parity, sensitivity, and transformers, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.302058Z"},"links":{"cited_paper":"/paper/2602.05896","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:f57633a9132bb0a74c117a47bd959ae980ff97a4779b13d2806e024ed86f47b9","observation_id":"76a9cb42-cb5e-4237-a28f-f33abdec2ea0","resolution":{"observed_at":"2026-08-08T00:18:21.302058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03130","last_updated":"2017-03-09T04:42:30Z","snapshot_observed_at":"2026-08-01T16:29:44.580051Z","submitted_at":"2017-03-09T04:42:30Z","title":"A Structured Self-attentive Sentence Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03130","snapshot_observed_at":"2026-08-08T00:18:21.306038Z","title":"A structured self-attentive sentence embedding, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.306038Z"},"links":{"cited_paper":"/paper/1703.03130","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:0365354962ff20ff4d4bbc2d59cd329b846b4e573218c585691de1b0ddf78a6d","observation_id":"5fb54950-2674-4625-a638-182a5182679b","resolution":{"observed_at":"2026-08-08T00:18:21.306038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10749","last_updated":"2023-05-02T14:16:15Z","snapshot_observed_at":"2026-08-10T14:40:09.922399Z","submitted_at":"2022-10-19T17:45:48Z","title":"Transformers Learn Shortcuts to Automata","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10749","snapshot_observed_at":"2026-08-08T00:18:21.309970Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.309970Z"},"links":{"cited_paper":"/paper/2210.10749","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:7d412e304f60483a591df6bb4dd21f5a33725ef44777dbb272cf05fa30a499c0","observation_id":"caefcef9-4e90-4bb7-942e-547adae906e2","resolution":{"observed_at":"2026-08-08T00:18:21.309970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00729","last_updated":"2023-04-26T22:34:12Z","snapshot_observed_at":"2026-08-10T06:52:54.079780Z","submitted_at":"2022-07-02T03:49:34Z","title":"The Parallelism Tradeoff: Limitations of Log-Precision Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00729","snapshot_observed_at":"2026-08-08T00:18:21.313898Z","title":"The parallelism tradeoff: Limitations of log-precision transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.313898Z"},"links":{"cited_paper":"/paper/2207.00729","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:efbfd4d23a156378fe6720266bbea74b46d717f341b1b049b3c3e6931fc53463","observation_id":"47e1666f-4154-4b48-8459-8b05e6873af5","resolution":{"observed_at":"2026-08-08T00:18:21.313898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.317980Z","title":"A little depth goes a long way: The expressive power of log-depth transformers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.317980Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:c4a4dace710b9da56ce5f0cbada3657b649660c51181e11650426d61cda18c9d","observation_id":"71fd7570-6819-4b95-ac42-3ab8b4eddf44","resolution":{"observed_at":"2026-08-08T00:18:21.317980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.068529Z","title":"MIT Press, 1969","venue":null,"work_id":"1b389efd-f79c-4461-a3f7-d0a2c8ae576f","year":1969},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.321519Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:8df39eb97dd190e83eab3067d7af8071a834fcd80360a0a3bd5d3b2a2225e046","observation_id":"2d75c8df-a37a-42e2-8d8a-d4781998d7e0","resolution":{"observed_at":"2026-08-08T00:18:22.073725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.056540Z","title":"On extremalh-basesA 4.Mathematica Scandinavica, pages 5–16, 1987","venue":null,"work_id":"daf17d5e-b1ab-4af1-a148-1a66309d34c4","year":1987},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.325523Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:7d883844c9f2c27a0609598b786fcc7230ff356982d36086bf23a6a4f60b2448","observation_id":"24014eb0-7bb2-4264-8ee1-3be0cf195f86","resolution":{"observed_at":"2026-08-08T00:18:22.060522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.043997Z","title":"Parikh, Oscar T¨ ackstr¨ om, Dipanjan Das, and Jakob Uszkoreit","venue":null,"work_id":"d56c3393-6f82-4564-b2ff-3839c6e2cf3a","year":2016},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.329456Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:b9852b8ea630a74ff4b6c5d924c41230e454059b018235f3680acc33621c7d74","observation_id":"498004a0-0b53-4e41-aa13-dd2a21b536ff","resolution":{"observed_at":"2026-08-08T00:18:22.048792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08164","last_updated":"2024-02-26T22:12:37Z","snapshot_observed_at":"2026-08-09T19:29:39.578136Z","submitted_at":"2024-02-13T01:52:15Z","title":"On Limitations of the Transformer Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08164","snapshot_observed_at":"2026-08-08T00:18:21.333110Z","title":"On limitations of the transformer architecture, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.333110Z"},"links":{"cited_paper":"/paper/2402.08164","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:df1d4f1342708a8ff302f62bdba8b3b4d6841a99750665030c3e2eeab2ef4734","observation_id":"3d1fc906-9e41-496d-9e51-3b2d265a29ef","resolution":{"observed_at":"2026-08-08T00:18:21.333110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02896","last_updated":"2023-11-16T14:48:16Z","snapshot_observed_at":"2026-08-07T11:02:21.213228Z","submitted_at":"2023-06-05T14:05:04Z","title":"Representational Strengths and Limitations of Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02896","snapshot_observed_at":"2026-08-08T00:18:21.336902Z","title":"Representational strengths and limitations of transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.336902Z"},"links":{"cited_paper":"/paper/2306.02896","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:d43c87a2e1799db5f42c55fa2b737d9fdb4b94da7b2a6395abdf5ea821aeb6c4","observation_id":"d33e055e-3c73-4dd4-b5af-c34cfbdbbfa7","resolution":{"observed_at":"2026-08-08T00:18:21.336902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14332","last_updated":"2024-08-26T15:01:04Z","snapshot_observed_at":"2026-07-06T19:06:01.833508Z","submitted_at":"2024-08-26T15:01:04Z","title":"One-layer transformers fail to solve the induction heads task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14332","snapshot_observed_at":"2026-08-08T00:18:21.340892Z","title":"One-layer transformers fail to solve the induction heads task, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.340892Z"},"links":{"cited_paper":"/paper/2408.14332","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:0565ef557183316adcbcdc536dd8d074978d09b1e2c35eebc92faf7c09668eac","observation_id":"051c6149-ca24-471d-b529-490d31c9ce77","resolution":{"observed_at":"2026-08-08T00:18:21.340892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09268","last_updated":"2024-02-14T15:54:55Z","snapshot_observed_at":"2026-08-10T12:40:38.754076Z","submitted_at":"2024-02-14T15:54:55Z","title":"Transformers, parallel computation, and logarithmic depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09268","snapshot_observed_at":"2026-08-08T00:18:21.344801Z","title":"Transformers, parallel computation, and logarithmic depth, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.344801Z"},"links":{"cited_paper":"/paper/2402.09268","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:1e9bbf53f4c1216eed6c0e17feb8a3d616cecdb676c1232784d6ad94492e4120","observation_id":"48531fbb-2db5-48df-81aa-e580a0e89e06","resolution":{"observed_at":"2026-08-08T00:18:21.344801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.032274Z","title":"Michael Steele","venue":null,"work_id":"275173fd-1061-4a34-ab2c-6fc5ddb4afff","year":1995},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.348843Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:674be73f8562184a587bbb683ed12c86725013e3f09093c5562d6a811147dfb1","observation_id":"3572037c-6138-493a-9579-9af6931d4231","resolution":{"observed_at":"2026-08-08T00:18:22.036272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.018931Z","title":"Two (narrow) heads are better than (an arbitrarily wide) one","venue":null,"work_id":"e1ba0eaa-1368-414e-a453-6b742eb6604f","year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.352690Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:2d0e34b3d7f707e5a8126a30b0e691433ad08bec7246fe585a1f4a3a1083451d","observation_id":"1bc22d14-85ab-4ab8-9226-780acbecdcd3","resolution":{"observed_at":"2026-08-08T00:18:22.023694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11684","last_updated":"2022-01-01T01:50:02Z","snapshot_observed_at":"2026-08-09T14:49:33.020574Z","submitted_at":"2020-02-26T18:21:34Z","title":"Provable Meta-Learning of Linear Representations","version":5},"cited_work":{"arxiv_id":"2002.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.11684","snapshot_observed_at":"2026-08-08T00:18:21.599543Z","title":"Provable Meta-Learning of Linear Representations","venue":"cs.LG","work_id":"4518aa9b-1c2d-4ced-9a0a-978c3c10943f","year":2020},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.356398Z"},"links":{"cited_paper":"/paper/2002.11684","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:19d03cce2eded454e5eafe5ce50475c81d2933126c1b4b77289e6f2ec7358a13","observation_id":"d4d4992b-038f-4689-84bd-dee00bacecc8","resolution":{"observed_at":"2026-08-08T00:18:21.606190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T00:18:21.360698Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.360698Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:a98bff657f06095164dfea2ad91bb63d90d21ebb75dc61932a202b9972f9f493","observation_id":"8fd733dc-924f-484b-93c3-d12b024079b5","resolution":{"observed_at":"2026-08-08T00:18:21.360698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:22.005967Z","title":"How many attention heads do you need to do XOR? Less- Wrong, April 2026","venue":null,"work_id":"678f906d-53ea-4064-b780-f96946722434","year":2026},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.364343Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:3812211e42837838ba0e0d9587d28ea1762322415bb72de4f530f4485cd3f014","observation_id":"2408cfa7-0502-41ae-b245-066f891eae5c","resolution":{"observed_at":"2026-08-08T00:18:22.010506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.368013Z","title":"The effect of attention head count on transformer approximation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.368013Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:32c64ddc897380f974fc4e6f40b652e1bf482a14005b178c40c26b52217e5566","observation_id":"5d9b7bb5-d0d6-46f8-abba-e9f5e21e4e7f","resolution":{"observed_at":"2026-08-08T00:18:21.368013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.992617Z","title":"On model selection consistency of Lasso.Journal of Machine Learning Research, 7(90):2541–2563, 2006","venue":null,"work_id":"481ff363-64ef-481a-93ce-26ee0dcdcb7a","year":2006},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.371426Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:7954e5fe9b368df1ec27cf27951f1e77d1162f19d5357fbe0317c191e79a455e","observation_id":"27bcb3fe-850e-417f-ba15-f50b2327d058","resolution":{"observed_at":"2026-08-08T00:18:21.996759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.980441Z","title":"The minimum isx, so MX i=1 hi∆x,y i >0","venue":null,"work_id":"5dbb3d92-f161-46ad-9f20-e1430173b805","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.375082Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:01036cb480c145687bd25ff207c28bd188ed9a327f3a9f9c26b722eac4923df1","observation_id":"4e66ea80-6457-42b4-a9a8-0a56c692998e","resolution":{"observed_at":"2026-08-08T00:18:21.984579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.965590Z","title":"The minimum isy, so MX i=1 hi∆x,y i <0","venue":null,"work_id":"803d444e-983e-49bf-9d33-c322d34005b5","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.379016Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:7deeff4e2cc5b803e80e8d58467d6f5dc67cabf46eb58e06029045de2d448e28","observation_id":"3049d316-95d1-4bbb-99a4-76cc3c1f9525","resolution":{"observed_at":"2026-08-08T00:18:21.969906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.952865Z","title":"The minimum is x, so MX i=1 hi∆x,y i >0","venue":null,"work_id":"a69d38a8-429c-44f5-b142-898a066471c1","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.382881Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:62f5bdaf3296b7fef16de0459671660b2735028b4c70583f807363d5dc218b31","observation_id":"671be709-4fd8-4075-93f0-72aa06b3852b","resolution":{"observed_at":"2026-08-08T00:18:21.957041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:18:21.940306Z","title":"The minimum is y, so MX i=1 hi∆x,y i <0","venue":null,"work_id":"37136a9b-4ddf-4c4b-b02e-302004c3a896","year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.386846Z"},"links":{"citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:7f6605fa2a8c11f406c3fb836ee02ad50d6342f7b8ad6470e1f7d1d57f9e6f38","observation_id":"28a3a314-70e2-4275-85c7-7c5200590df7","resolution":{"observed_at":"2026-08-08T00:18:21.944419Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-08-08T18:12:49.793504Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-08T00:18:21.263783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.263783Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:d6c29f6f1f010cba950b99ae2874326ab6c943a244064687aab6b8c0ca82f9f8","observation_id":"2b3d7df0-27b4-4bd4-bce4-d824ce19a4e0","resolution":{"observed_at":"2026-08-08T00:18:21.263783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T21:28:28.449362Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":4,"verified_fuzzy":15},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.04243."}