{"as_of":"2026-08-21T19:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2427b20a1db27198af926e805557311427ed7b3c1aa032a5ecb1029db452380c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:49:15.637004Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:07:09.244510Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":"2106.03764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-07-02T16:07:09.244510Z","title":"On the expressive power of self-attention matrices","venue":null,"work_id":"90bf1806-d608-4193-a076-0826a40dc837","year":2021},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-20T21:36:51.212852Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:e59d25aa6de48b327d9bbd8c860b60f3e29aafabfd25cbd7bcef7bf9993cd70a","observation_id":"e16670d8-40d1-4f20-8134-227a63d0a8e5","resolution":{"observed_at":"2026-05-17T18:00:50.487379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-08-12T17:05:46.778144Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13028","last_updated":"2024-11-20T04:20:17Z","snapshot_observed_at":"2026-08-17T17:41:41.193965Z","submitted_at":"2024-11-20T04:20:17Z","title":"A Theory for Compressibility of Graph Transformers for Transductive Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T17:05:46.778144Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2411.13028"},"observation_digest":"sha256:1ff4f22fbb0a79a380b959ed9d0bdcc11e796480bf48cde3e8bf7c97427210e9","observation_id":"e438c3b7-fe55-4df0-8a73-d28372071b9c","resolution":{"observed_at":"2026-08-12T17:05:46.778144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-08-07T10:33:40.270823Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05200","last_updated":"2025-08-28T16:07:16Z","snapshot_observed_at":"2026-08-16T20:35:08.271380Z","submitted_at":"2025-06-05T16:12:51Z","title":"Transformers Meet In-Context Learning: A Universal Approximation Theory","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:40.270823Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2506.05200"},"observation_digest":"sha256:de8cb008de419bb9c485e0eb1b6d661935d00cd3b35cd418f615c2f02e4add1e","observation_id":"41d3ef9c-2de4-41fd-9c7d-7c548ac28b21","resolution":{"observed_at":"2026-08-07T10:33:40.270823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-08-07T10:35:36.139688Z","title":"Likhosherstov, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-16T04:39:11.654884Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:36.139688Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:433427bc4b51f9af5df26ba00fdbb04ecb99b7169f34286a751d2af8e7fc13d3","observation_id":"dae4161d-c791-40f6-9e6c-693df28b69e8","resolution":{"observed_at":"2026-08-07T10:35:36.139688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-08-07T06:10:19.335874Z","title":"On the Expressive Power of Self - Attention Matrices , June 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06179","last_updated":"2025-06-06T15:44:10Z","snapshot_observed_at":"2026-08-18T01:32:49.064700Z","submitted_at":"2025-06-06T15:44:10Z","title":"A Theoretical Study of (Hyper) Self-Attention through the Lens of Interactions: Representation, Training, Generalization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:10:19.335874Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2506.06179"},"observation_digest":"sha256:b976e830851a473b134b8e55a268283e7b7794b32389d409a7ea2b5eea256025","observation_id":"a19f856e-914a-4962-bedf-4c7694a05efa","resolution":{"observed_at":"2026-08-07T06:10:19.335874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-08-15T15:49:15.637004Z","title":"On the expressive power of self-attention matrices.arXiv preprint arXiv:2106.03764,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22307","last_updated":"2026-06-22T15:13:12Z","snapshot_observed_at":"2026-08-18T00:33:00.277015Z","submitted_at":"2025-09-26T13:12:43Z","title":"Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:49:15.637004Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2509.22307"},"observation_digest":"sha256:9b85d38039731a76b91f2c15b1a6c91b53cd0dc9f2a2a30db3f743dba9fe9b3f","observation_id":"b1cb341f-a7b4-484e-9edb-60d51ab010aa","resolution":{"observed_at":"2026-08-15T15:49:15.637004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":"2106.03764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-07-02T16:07:09.244510Z","title":"On the expressive power of self-attention matrices","venue":null,"work_id":"90bf1806-d608-4193-a076-0826a40dc837","year":2021},"citing_paper":{"arxiv_id":"2604.19147","last_updated":"2026-04-21T06:54:16Z","snapshot_observed_at":"2026-08-15T05:02:33.133394Z","submitted_at":"2026-04-21T06:54:16Z","title":"Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:08.351368Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2604.19147"},"observation_digest":"sha256:bcd131efcdfc48cd623fd15c530777120864562d1e918e55287b39ff0525511a","observation_id":"da8a465b-761c-47b6-bc01-42d036604257","resolution":{"observed_at":"2026-05-11T12:41:04.835429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":"2106.03764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-07-02T16:07:09.244510Z","title":"On the expressive power of self-attention matrices","venue":null,"work_id":"90bf1806-d608-4193-a076-0826a40dc837","year":2021},"citing_paper":{"arxiv_id":"2605.25619","last_updated":"2026-05-25T09:20:41Z","snapshot_observed_at":"2026-08-15T08:11:08.041580Z","submitted_at":"2026-05-25T09:20:41Z","title":"Analogies between Transformer Layers and Power Method","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T22:59:25.289762Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2605.25619"},"observation_digest":"sha256:9d0653cfc065f24ace5ef150fe13048c1c238917425d36f75b2503c6d0249db8","observation_id":"1ed87fb8-3af5-4121-bb4b-e6d5813b42fa","resolution":{"observed_at":"2026-06-29T23:04:01.118155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":"2106.03764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-07-02T16:07:09.244510Z","title":"On the expressive power of self-attention matrices","venue":null,"work_id":"90bf1806-d608-4193-a076-0826a40dc837","year":2021},"citing_paper":{"arxiv_id":"2606.00605","last_updated":"2026-05-30T08:05:27Z","snapshot_observed_at":"2026-08-20T23:55:46.585487Z","submitted_at":"2026-05-30T08:05:27Z","title":"Looped Transformers with Layer Normalization Provably Learn the Power Method","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T19:03:51.212121Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2606.00605"},"observation_digest":"sha256:ac5bbef8eae6508975bd7981b5c6cf7f3cf56bb42840067e6d68b7a80aacc42f","observation_id":"799df850-cbc4-4436-8b2d-93ae6a3b9a51","resolution":{"observed_at":"2026-06-28T19:22:35.265340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices","version":2},"cited_work":{"arxiv_id":"2106.03764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03764","snapshot_observed_at":"2026-07-02T16:07:09.244510Z","title":"On the expressive power of self-attention matrices","venue":null,"work_id":"90bf1806-d608-4193-a076-0826a40dc837","year":2021},"citing_paper":{"arxiv_id":"2606.05748","last_updated":"2026-06-04T06:20:23Z","snapshot_observed_at":"2026-08-16T21:29:02.433077Z","submitted_at":"2026-06-04T06:20:23Z","title":"UNIVID: Unified Vision-Language Model for Video Moderation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-27T22:56:26.674841Z"},"links":{"cited_paper":"/paper/2106.03764","citing_paper":"/paper/2606.05748"},"observation_digest":"sha256:81ac9dd0d4553c0d618f550725cc406b9b8ed9af873d9555b4d2f0d49e1002d9","observation_id":"e8c213b2-ba2d-4643-82aa-08986371a909","resolution":{"observed_at":"2026-07-02T16:07:09.246168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2106.03764/citation-record","integrity":"/paper/2106.03764/integrity","json":"/paper/2106.03764/citation-record.json","paper":"/paper/2106.03764"},"outbound":[],"paper":{"arxiv_id":"2106.03764","last_updated":"2021-06-08T10:02:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T18:19:01.288355Z","submitted_at":"2021-06-07T16:30:28Z","title":"On the Expressive Power of Self-Attention Matrices"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2106.03764."}