{"as_of":"2026-08-17T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7270a1a8562e38b49c5e3f62126b16f0cef0fe9f949827e020b6b0cf4a2c0f99","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:12:48.259338Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:17:09.834609Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:05:58.230449Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"cited_work":{"arxiv_id":"2506.12220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Two heads are better than one: simulating large transformers with small ones","venue":null,"work_id":"20dd94c9-701c-42fe-ba76-8894c62c20e2","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2506.12220","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:b44e41d1f88eb7ae93164f3817c4c6b1b5a0585796e3eeb6a3f731b4e3281a63","observation_id":"795242bf-3d0f-49a8-96ad-9f827583f903","resolution":{"observed_at":"2026-05-11T09:05:58.232597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12220/citation-record","integrity":"/paper/2506.12220/integrity","json":"/paper/2506.12220/citation-record.json","paper":"/paper/2506.12220"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.891226Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"0355d266-befe-4517-9dc0-a0843a5f770c","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.079998Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:1c71eec3fe6a046515d183af4e6b8b4c9550e547bf58377e2afb07e90c3558e2","observation_id":"6b51397b-9819-4a56-bba0-0277ff4eb8cd","resolution":{"observed_at":"2026-08-07T01:12:48.896786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.875764Z","title":"Fast attention requires bounded entries","venue":null,"work_id":"5f12b229-21d9-45b7-a13f-a3ed69cc525b","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.085462Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:4cd58c2507deb950e220acd808a71156d3504afebd4adf027aaa2f19818740db","observation_id":"af1324c6-0fab-4832-a706-76dc132db978","resolution":{"observed_at":"2026-08-07T01:12:48.880702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.860964Z","title":"Fundamental limitations on subquadratic alternatives to transformers","venue":null,"work_id":"9d7fa699-a558-473c-9a0f-c4a2989b1605","year":2025},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.090223Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:85bda43d064f5c39090832b346b96314819c51d192c0d33004357178070fa689","observation_id":"8a8047c2-678c-45a3-a1ac-422c5871ea0f","resolution":{"observed_at":"2026-08-07T01:12:48.865671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.845671Z","title":"On the A bility and L imitations of T ransformers to R ecognize F ormal L anguages","venue":null,"work_id":"83ae1510-8c60-49a2-9288-f35033c35928","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.095765Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:d31d21d3558f175ae079e8fc0015eea37aa301ba77bc2d6c9f2d37827795a6d8","observation_id":"7945a37a-e689-418e-b8c0-acba451ad33f","resolution":{"observed_at":"2026-08-07T01:12:48.850871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.829481Z","title":"Separations in the representational capabilities of transformers and recurrent architectures","venue":null,"work_id":"227a68b8-3112-4c38-965c-369e5430458f","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.100144Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:64ee37e38cec27807ba76f7f8048849061c6479e12355a0e336b0784f7983d05","observation_id":"fa65ef42-f46d-40c2-93c3-37b94a062016","resolution":{"observed_at":"2026-08-07T01:12:48.835057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T01:12:48.104615Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.104615Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:6f0352e502f07626bd302500c3987e1f9cc316743c7d98def64ff829761c374a","observation_id":"024fca3b-7758-4ed9-9ec7-c685edee9285","resolution":{"observed_at":"2026-08-07T01:12:48.104615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.814067Z","title":"An exploration of hierarchical attention transformers for efficient long document classification, 2022","venue":null,"work_id":"1e4713d2-9854-4a7b-81a5-abac08245758","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.110449Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:c4e36f13e8177b01689fb199f17009ec530acb1e51184a72e00857b710ea8197","observation_id":"addbc6b7-327f-4df2-a6d5-7a5383a7a3a4","resolution":{"observed_at":"2026-08-07T01:12:48.819050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.114975Z","title":"Colwell, and Adrian Weller","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.114975Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:4becaf2de31a2519c9582cff4f33b642bf6ec2f1be11e66cf07a55062ff14fdb","observation_id":"d63ca6e3-07d2-4db9-ada5-861a5bfe1370","resolution":{"observed_at":"2026-08-07T01:12:48.114975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.789513Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"f210bc37-0572-4161-97b0-9e06f411b87a","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.119593Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:c43f6126debc794ad3c1f98310b9c9bed9934b5037bf1686ffa61f3e104abd36","observation_id":"208bc6d9-2b45-4ef8-adae-3785c449204f","resolution":{"observed_at":"2026-08-07T01:12:48.794430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T01:12:48.123953Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.123953Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:45b217a5f18c7b79661d25b298c8149e0773f7a17f7c217022676fef3fc56136","observation_id":"c0d9153c-e51b-4936-abef-f0a471cc6c8c","resolution":{"observed_at":"2026-08-07T01:12:48.123953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.774974Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R\\' e","venue":null,"work_id":"20078798-4029-4ddb-9647-fa6b54023c8a","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.128702Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:e822caace7151f0bd1e51d2c17fe3ae2f43950ca95ad983af47d6a3e8f260d69","observation_id":"74419346-96a3-4ec1-940e-a64dd8201936","resolution":{"observed_at":"2026-08-07T01:12:48.779890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.759820Z","title":"Etched is Making the Biggest Bet in AI","venue":null,"work_id":"c2c5b585-3fcb-43be-95ca-dde748344613","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.133124Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:ab8236fb46d4561a041357cbda87deeedf98b528b720b106c3c8a226cc429efb","observation_id":"02e50453-d976-4a8e-a032-008066dfdcaf","resolution":{"observed_at":"2026-08-07T01:12:48.765080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T01:12:48.138043Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.138043Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:b681f847d15515edff211ef28653052461a20272e05a03c6509fa34d3e56aaed","observation_id":"f4cb5a0f-b75d-436c-996d-6573336e49c3","resolution":{"observed_at":"2026-08-07T01:12:48.138043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.744093Z","title":"Theoretical limitations of self-attention in neural sequence models","venue":null,"work_id":"aebb2789-e602-48b1-ba51-4638ce1d7956","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.143413Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:ee5d293d328f53d9442a4d6eb23ad22c3982cf09556c9c1994d0559a1c652823","observation_id":"a02b2ac7-3259-4954-8b3e-8da43426ddb9","resolution":{"observed_at":"2026-08-07T01:12:48.748865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.728833Z","title":"Hyperattention: Long-context attention in near-linear time","venue":null,"work_id":"b860268d-3d9b-44ad-b98b-8572c19a68a7","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.148089Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:4af7975610f3349f9b1f222872ab27213268730c126ebbdcf6e87ae3bb1548de","observation_id":"38ea6915-586e-4ae5-941a-ada67e86cc74","resolution":{"observed_at":"2026-08-07T01:12:48.734346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.713406Z","title":"Computational limits of low-rank adaptation (lo RA ) fine-tuning for transformer models","venue":null,"work_id":"b39e8f50-e086-464f-94cb-06b8bb30b4eb","year":2025},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.152253Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:5ebd74603d3ae807dc8e359deaae89a1d1ccf157f2fea6b020e04317ddf4bcfe","observation_id":"08d07ec7-a333-4c40-8c90-2aa45499d470","resolution":{"observed_at":"2026-08-07T01:12:48.719060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.699076Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":"e3129103-9c33-4409-a6ab-9f24cf21c564","year":1989},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.156366Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a86649d2816c4d2b6b64272c7a21b51987937e529074f309777fc42c4b10e212","observation_id":"fe1866d1-3cbd-4e71-9b22-14369cd71c7c","resolution":{"observed_at":"2026-08-07T01:12:48.703811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.684154Z","title":"On statistical rates and provably efficient criteria of latent diffusion transformers (dits)","venue":null,"work_id":"5e693ec4-57ac-45a6-98bd-3634e1d85078","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.160515Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:574729ecc4c4a9a280dbf6afbce793e1cf5ff4acbaf71d29008962f37b80ba8c","observation_id":"38e00788-d632-489c-995f-418982c0cfe1","resolution":{"observed_at":"2026-08-07T01:12:48.689004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.165303Z","title":"Kakade, and Eran Malach","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.165303Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:69b7310190387ff4d738e9f5bd88d66b690212d477f55760d0ce2837b9428d2b","observation_id":"7cdac334-4f01-435b-8d57-51f8908b4925","resolution":{"observed_at":"2026-08-07T01:12:48.165303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.659256Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"5ab3b3b8-bd27-44a6-b3be-67fa446f78a6","year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.170867Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:071e69d4c339fe3e9fe3143238e072a7a175b9f7017fc2c140c18bce9e394f84","observation_id":"acebf52c-beb3-4a63-ab6c-4ac01dd9cf27","resolution":{"observed_at":"2026-08-07T01:12:48.663817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.645435Z","title":"RNGD preview: The world's most efficient AI chip for LLM inference","venue":null,"work_id":"1b1cf127-5545-4d11-8e1f-0455cd8d1326","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.175070Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:bdc6758fc586ee365ef6c5a467991db826c35c1de6103912767b7a24aea559da","observation_id":"e9d094b8-0055-414d-9fb4-a96198d7feb0","resolution":{"observed_at":"2026-08-07T01:12:48.650041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.631447Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"c50f634d-ed21-429f-a443-483a10e1ed1d","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.178891Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:949e43e46da198078e1124689fa8054355bb3c7d060ee22a08d02b2c500573f2","observation_id":"d80f281d-47c8-4a70-a344-5a40cd0df65d","resolution":{"observed_at":"2026-08-07T01:12:48.635829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.617570Z","title":"Polysketchformer: fast transformers via sketching polynomial kernels","venue":null,"work_id":"4fe8a121-8dd4-485b-a865-4b79e8f8dd98","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.182787Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a2e929762a2871be3d51d4957f40b201ede32a3ab8c7008aa995c41ea822430e","observation_id":"278afdd6-e958-4ee1-906d-af3f472e816a","resolution":{"observed_at":"2026-08-07T01:12:48.622136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.603074Z","title":"Ash, Surbhi Goel, Akshay Krishnamurthy, and Cyril Zhang","venue":null,"work_id":"52c9456f-6fe1-498d-b6a7-e62493e0cdf2","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.186811Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:64d7fd3bb4594da6a7e84a28619e02431029546abc08533ad0df934ccf7f13f4","observation_id":"48ed1d42-b864-410a-bf0b-22644b5e50be","resolution":{"observed_at":"2026-08-07T01:12:48.608236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.588354Z","title":"On the expressive flexibility of self-attention matrices","venue":null,"work_id":"15396cbb-9f87-4359-a970-bc74ab6080c0","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.190765Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:09ec700957c3cdc97854d5fccf945ab676644738d5f65be30648f93fdf74ca60","observation_id":"ed2960ec-a1f8-4d69-88f3-f2648a08b744","resolution":{"observed_at":"2026-08-07T01:12:48.593022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.574554Z","title":"Hierarchical transformers for multi-document summarization","venue":null,"work_id":"e7f0d630-b50e-4af8-8634-883bcd67efab","year":2019},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.194683Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:f78ff0b5b511f9268f2cb9dc48ba52d7bcd0c6b2b20ef24331f11f18bb65b3f6","observation_id":"c29f4383-d564-47e4-b9a4-2b207dacee37","resolution":{"observed_at":"2026-08-07T01:12:48.578990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.559832Z","title":"The parallelism tradeoff: Limitations of log-precision transformers","venue":null,"work_id":"04b23362-584b-40b7-b002-0551dbfe1319","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.198545Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:614dc7a3faef960d98de9ab4c82eea73a9ad4f586acc7e0124923864a201d150","observation_id":"d90d4e61-9a47-4870-896a-c408cef07b8b","resolution":{"observed_at":"2026-08-07T01:12:48.564989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.545482Z","title":null,"venue":null,"work_id":"46079d82-fec8-44fa-834b-78046245311a","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.202818Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:03a47eb30548ce6806c33f33e21ab305fda3d69855dee659965abab493b31d32","observation_id":"fc1f91c6-6d9a-44ea-9d52-57cf35de5df0","resolution":{"observed_at":"2026-08-07T01:12:48.550241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.531421Z","title":"Language models are few-shot learners","venue":null,"work_id":"e06a64df-1ad7-4029-a9ef-c89027d26df1","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.206861Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:d84ddf83466489e4df84cca8712b701821453d83a238e090e47eb53e0f67f49b","observation_id":"3bb1e02f-d1fa-4f28-9bbd-3aa12a639221","resolution":{"observed_at":"2026-08-07T01:12:48.535978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.517171Z","title":"Hierarchical transformers for long document classification","venue":null,"work_id":"d14a15ce-3036-453f-b79a-32e966e77036","year":2019},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.210920Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:a35ce993803f1b84532da0316bab85a12a6f48b9b3530104aa31a02622914138","observation_id":"3b258ad8-d2ad-446f-badb-12896773279a","resolution":{"observed_at":"2026-08-07T01:12:48.521713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.503153Z","title":"Representational strengths and limitations of transformers","venue":null,"work_id":"e25e6342-02f4-4c4d-875a-5962795fcda2","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.214838Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:ed2dd2fe05f0cc9bb0193198bab5caa46860c5ec2ad7e4bc69cfaf07f141c54e","observation_id":"b661e8a2-a0a8-4843-add4-4105573376c4","resolution":{"observed_at":"2026-08-07T01:12:48.507820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.487968Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":"1d736ea7-0bdd-4433-997d-f3f7bdd8e83b","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.218877Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:1f639fbf058340a80e00cd9580af609603b4cd4496ad1f03c44a129a66d90d52","observation_id":"3ef4a2f6-b742-4a37-a5c6-ff8c5eba978d","resolution":{"observed_at":"2026-08-07T01:12:48.493360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.472649Z","title":"What formal languages can transformers express? a survey","venue":null,"work_id":"36338ccf-097a-45b6-8d24-35bdc5695707","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.223004Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:43156b1dccfc9159be3b99061e56b08f4c092d513a436496446700149cb897e7","observation_id":"44e1558a-3115-4c57-9557-a69b1b43a757","resolution":{"observed_at":"2026-08-07T01:12:48.477544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.457683Z","title":"Efficient transformers: A survey","venue":null,"work_id":"870c1c6e-1f63-4dfe-931d-3ee9b8fe7788","year":2022},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.227406Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:0d263a8bc841b17d9aeccf99e4da2d1c5066ad584a9c37065a627f40fbbc0b9a","observation_id":"c1d55e78-58a6-4b59-9ea1-a56d3a76e0b8","resolution":{"observed_at":"2026-08-07T01:12:48.462466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.441408Z","title":"Schmidt, and Stephan Peitz","venue":null,"work_id":"6dbe6def-eda4-483d-9106-f0338c9d13a8","year":2023},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.231424Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:d6a9a009dab6571de205a57f5834ec7f4cf5774bba42a87a12847a233b214ae6","observation_id":"9445936f-2977-44c6-af2d-d60cdfd6cd04","resolution":{"observed_at":"2026-08-07T01:12:48.446971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.424791Z","title":"Gomez, ukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"0e2b93c6-c076-46ee-bd68-59f3636ad200","year":2017},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.235774Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:1159d613d59a2c5e5483ec3382581e35764c0c53e985f20ab68da3085d6a7fe9","observation_id":"b3536e4d-94ec-4bcd-bfec-8e67154f4f8e","resolution":{"observed_at":"2026-08-07T01:12:48.429843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.409310Z","title":"RNN s are not transformers (yet): The key bottleneck on in-context retrieval","venue":null,"work_id":"3f641cd1-a519-426b-941b-3dfd9a793006","year":2025},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.240370Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:14b8bb8728235cd21948008f9fdea2c7040b78de3589e480980f4fddd19c1c09","observation_id":"80d2ebdf-30d9-43e7-b2e9-9935b9e57e94","resolution":{"observed_at":"2026-08-07T01:12:48.414278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05722","last_updated":"2022-06-16T11:29:37Z","snapshot_observed_at":"2026-08-17T20:48:49.998046Z","submitted_at":"2021-10-12T03:17:03Z","title":"LightSeq2: Accelerated Training for Transformer-based Models on GPUs","version":3},"cited_work":{"arxiv_id":"2110.05722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.05722","snapshot_observed_at":"2026-08-07T01:12:48.296214Z","title":"LightSeq2: Accelerated Training for Transformer-based Models on GPUs","venue":"cs.CL","work_id":"c6023a77-e9cd-4822-8baa-bbb0fd71705c","year":2021},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.245834Z"},"links":{"cited_paper":"/paper/2110.05722","citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:4ed944cee7703c3a35f42a7f2a4862fd24b9898477de2a663fa2cdb8a20ff67b","observation_id":"de93e740-306e-4720-b64c-b46d5a14bddd","resolution":{"observed_at":"2026-08-07T01:12:48.303846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.393451Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"7441ae13-6f85-40e7-a48b-30168eba4e07","year":2024},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.251148Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:0900e1f3a583e5456e76d934197d08acf28e585efe9aa1e858788b830be9c398","observation_id":"7d215dfb-3d60-43fe-8962-399d38217616","resolution":{"observed_at":"2026-08-07T01:12:48.398365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.377687Z","title":"Are transformers universal approximators of sequence-to-sequence functions? In International Conference on Learning Representations , 2020","venue":null,"work_id":"61ffec2c-f6e4-4d88-aff8-eaae9fc58df3","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.255183Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:b9c258671073c5a91e407dad8f07a1d4d8a664ca649e4f1c0ea8f3d2fbcbbc88","observation_id":"12d921ac-cc04-4481-b458-297b95299f53","resolution":{"observed_at":"2026-08-07T01:12:48.382813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:12:48.361444Z","title":"Reddi, and Sanjiv Kumar","venue":null,"work_id":"8ddae1ea-c08a-4d36-b58f-1458c1d4e20c","year":2020},"citing_paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T01:12:48.259338Z"},"links":{"citing_paper":"/paper/2506.12220"},"observation_digest":"sha256:f0527907a3382ce8a6d9eaf3d0242aa01075090d766eba3dd6b83dcf4df0e97b","observation_id":"c1d80b37-089f-44c1-868f-5cd1ac530dc0","resolution":{"observed_at":"2026-08-07T01:12:48.366538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12220","last_updated":"2025-06-19T02:24:00Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T20:49:47.499768Z","submitted_at":"2025-06-13T20:47:12Z","title":"Two Heads Are Better than One: Simulating Large Transformers with Small Ones"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2506.12220."}