{"as_of":"2026-08-15T08:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:286e9c1da2ad39390fe869d9a9823ff9e742c2e81ded70f67da50a5c8ad54bfb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:25:02.732069Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:048d89a639d355f376ef1b4085513da8f3230a347fee28f922759f5ec62f5607","observation_id":"8501bb37-4668-4bfc-9689-f0dd56366d5b","resolution":{"observed_at":"2026-05-12T04:22:30.088404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:194fa1b1425210af9693c957a6477a01423f632fdc4ec15792984305f71a3f12","observation_id":"653efb2c-3ef8-4d44-b276-5311aa9a4380","resolution":{"observed_at":"2026-05-16T07:02:53.862054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2410.10629","last_updated":"2024-10-20T14:35:31Z","snapshot_observed_at":"2026-07-06T19:33:08.264958Z","submitted_at":"2024-10-14T15:36:42Z","title":"SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:50.009149Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2410.10629"},"observation_digest":"sha256:63af161e990c9af384db1c64dde13db92ffe832246027729d02024e5d3a36dd2","observation_id":"173022f9-3ad6-4e59-ae7f-05546af99168","resolution":{"observed_at":"2026-05-15T00:56:50.070029Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-12T14:25:02.732069Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15372","last_updated":"2024-11-22T23:03:35Z","snapshot_observed_at":"2026-08-12T18:53:52.484068Z","submitted_at":"2024-11-22T23:03:35Z","title":"Transforming NLU with Babylon: A Case Study in Development of Real-time, Edge-Efficient, Multi-Intent Translation System for Automated Drive-Thru Ordering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T14:25:02.732069Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2411.15372"},"observation_digest":"sha256:8f94166715d1a667bee02625c159fb52942dd515707e1b3d3ed4a640d55e8dc4","observation_id":"badd3ee9-56b1-40ae-8851-d1e1c3c20f38","resolution":{"observed_at":"2026-08-12T14:25:02.732069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-11T16:58:03.081142Z","title":"Transformer language models without positional en- codings still learn positional information","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09616","last_updated":"2024-12-13T04:58:33Z","snapshot_observed_at":"2026-08-14T18:32:28.081516Z","submitted_at":"2024-12-12T18:59:46Z","title":"V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:58:03.081142Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2412.09616"},"observation_digest":"sha256:f9337cd94bb74dd725fff3e82914856a8761d5a4f623a1e6dcc0a323b62234d4","observation_id":"93ad4f48-f28c-4dd8-8a82-6aa22e0e9cbe","resolution":{"observed_at":"2026-08-11T16:58:03.081142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-10T22:49:44.811424Z","title":"Transformer language models without positional encodings still learn positional information","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00712","last_updated":"2025-08-21T01:12:10Z","snapshot_observed_at":"2026-08-13T02:28:40.322487Z","submitted_at":"2025-01-01T03:23:00Z","title":"Rethinking Addressing in Language Models via Contexualized Equivariant Positional Encoding","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:49:44.811424Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2501.00712"},"observation_digest":"sha256:db7ef568bcf703765771c7289203a5c77f501806804b13a919b149137be8747f","observation_id":"efc5d93e-758c-404d-b3f3-fc444701bbdd","resolution":{"observed_at":"2026-08-10T22:49:44.811424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-10T18:00:52.931195Z","title":", author Ram, O","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11730","last_updated":"2025-01-20T20:29:40Z","snapshot_observed_at":"2026-08-12T09:06:13.418679Z","submitted_at":"2025-01-20T20:29:40Z","title":"Transformer Vibration Forecasting for Advancing Rail Safety and Maintenance 4.0","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T18:00:52.931195Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2501.11730"},"observation_digest":"sha256:f93563e17b17488da394916e04da1eebb80e8ecb1b4a9965ba5d0efc2b82d157","observation_id":"a9d86a93-f68e-4d2b-ab93-21b09c2b5825","resolution":{"observed_at":"2026-08-10T18:00:52.931195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-08T17:06:43.880176Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06902","last_updated":"2025-02-09T20:20:37Z","snapshot_observed_at":"2026-08-09T22:20:35.749492Z","submitted_at":"2025-02-09T20:20:37Z","title":"Emergence of Episodic Memory in Transformers: Characterizing Changes in Temporal Structure of Attention Scores During Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:06:43.880176Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2502.06902"},"observation_digest":"sha256:be45a6733e77ad623a75fbbe91215b3be1819340f404937d915b250c0c0403e4","observation_id":"f39a9532-9004-455c-8e24-47cfb80b006a","resolution":{"observed_at":"2026-08-08T17:06:43.880176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-08T16:11:43.141542Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08662","last_updated":"2025-06-02T04:54:00Z","snapshot_observed_at":"2026-08-09T07:57:07.000139Z","submitted_at":"2025-02-10T09:34:15Z","title":"RoToR: Towards More Reliable Responses for Order-Invariant Inputs","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T16:11:43.141542Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2502.08662"},"observation_digest":"sha256:6f5432155be5efcdb1f4632e4d3edfde449cebb703fbb5c81626f8daad09024a","observation_id":"50ff3154-c93e-41b1-81fe-ac5201bccfb2","resolution":{"observed_at":"2026-08-08T16:11:43.141542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-07T14:16:32.870058Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19544","last_updated":"2025-05-26T06:05:29Z","snapshot_observed_at":"2026-08-09T12:20:57.513529Z","submitted_at":"2025-05-26T06:05:29Z","title":"Unlocking the Power of Diffusion Models in Sequential Recommendation: A Simple and Effective Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.870058Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2505.19544"},"observation_digest":"sha256:829b84bf64d6f084a9ebf11cb7c375014a95bfca8fc63df70b1cf7863451756d","observation_id":"645af7c5-3042-4dfa-8376-beebab301aad","resolution":{"observed_at":"2026-08-07T14:16:32.870058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-07T00:45:02.420065Z","title":"Transformer language models without positional encodings still learn positional information.arXiv preprint arXiv:2203.16634, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-14T06:12:04.714492Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.420065Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:a6fb569e041017d3b11805d1a2e62e8cbf8b928d5605302b0bec249c5e54a41b","observation_id":"aaca7eb5-b6f8-4d09-a665-c5d4e9145c51","resolution":{"observed_at":"2026-08-07T00:45:02.420065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-06T05:57:33.919802Z","title":"Haviv, O","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01097","last_updated":"2025-08-01T22:24:15Z","snapshot_observed_at":"2026-08-11T18:28:56.329621Z","submitted_at":"2025-08-01T22:24:15Z","title":"Multispin Physics of AI Tipping Points and Hallucinations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:57:33.919802Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2508.01097"},"observation_digest":"sha256:2a3711e9d72c90d34171a9adbdac61e0a838c183d0054cb05a4fdfc47d59be48","observation_id":"76545f0f-3c66-46ae-ae27-bcac18cdf1ad","resolution":{"observed_at":"2026-08-06T05:57:33.919802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T13:29:01.272274Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00622","last_updated":"2025-08-30T22:31:55Z","snapshot_observed_at":"2026-08-08T02:31:50.485848Z","submitted_at":"2025-08-30T22:31:55Z","title":"BALM-TSF: Balanced Multimodal Alignment for LLM-Based Time Series Forecasting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:29:01.272274Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2509.00622"},"observation_digest":"sha256:f449d71ccd974c4a75de69f96aac9683c4ac7aa31a62fc5afd4f8a930fe2bcd2","observation_id":"2cf766f5-df18-47aa-b11b-5fea394327a3","resolution":{"observed_at":"2026-08-05T13:29:01.272274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T10:52:59.188637Z","title":"& Levy, O","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03643","last_updated":"2025-09-05T12:40:38Z","snapshot_observed_at":"2026-08-10T02:30:00.741465Z","submitted_at":"2025-09-03T18:50:03Z","title":"CEHR-XGPT: A Scalable Multi-Task Foundation Model for Electronic Health Records","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:52:59.188637Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2509.03643"},"observation_digest":"sha256:fcb22ce4b208679c432642367b2ca0413faee0e824ecc26422390804f894d0b4","observation_id":"024e6ef0-6e81-406a-b1d3-a2608f3f7300","resolution":{"observed_at":"2026-08-05T10:52:59.188637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T05:36:53.601520Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.05218","last_updated":"2025-09-08T03:13:38Z","snapshot_observed_at":"2026-08-14T23:22:55.529770Z","submitted_at":"2025-09-05T16:20:48Z","title":"HoPE: Hyperbolic Rotary Positional Encoding for Stable Long-Range Dependency Modeling in Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T05:36:53.601520Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2509.05218"},"observation_digest":"sha256:a04b540871973566abf01f14e69ed145e268618ecc6948a338af3820614ba6ee","observation_id":"7f806f3b-66bd-40bb-9b99-457706289e14","resolution":{"observed_at":"2026-08-05T05:36:53.601520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2509.12635","last_updated":"2026-05-10T22:28:15Z","snapshot_observed_at":"2026-08-14T18:40:13.165342Z","submitted_at":"2025-09-16T03:53:32Z","title":"Positional Encoding via Token-Aware Phase Attention","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T16:19:48.318702Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2509.12635"},"observation_digest":"sha256:3ea8b1a1508aee101836468c10ab7fcc3a10064c77f23c486edb5cf9dd590fe3","observation_id":"d7436bdc-b19f-41b3-897b-1d6b760aa2be","resolution":{"observed_at":"2026-05-18T16:21:36.609101Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2512.07805","last_updated":"2026-05-13T18:33:36Z","snapshot_observed_at":"2026-08-12T19:56:56.841927Z","submitted_at":"2025-12-08T18:39:13Z","title":"Group Representational Position Encoding","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T00:04:13.707931Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2512.07805"},"observation_digest":"sha256:341d74ce66767b8596bbd156c26d8b1ca41ba4dfc390674bd4ecb92c4147e4b7","observation_id":"156be933-1f63-4f5f-9a6b-30a8988c3a98","resolution":{"observed_at":"2026-05-17T00:08:43.767612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2603.22586","last_updated":"2026-05-14T05:50:23Z","snapshot_observed_at":"2026-07-06T22:50:14.856451Z","submitted_at":"2026-03-23T21:24:41Z","title":"A Foundation Model for Instruction-Conditioned In-Context Time Series Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T00:11:43.037956Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2603.22586"},"observation_digest":"sha256:df04c125b2caf379407912b42dd2f9db00dc545ab765ee38f9f27fa970b67b4f","observation_id":"a08c1a0f-9545-4905-8ec5-d1c1b43a7ee5","resolution":{"observed_at":"2026-05-15T00:13:21.732648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2603.22586","last_updated":"2026-05-14T05:50:23Z","snapshot_observed_at":"2026-07-06T22:50:14.856451Z","submitted_at":"2026-03-23T21:24:41Z","title":"A Foundation Model for Instruction-Conditioned In-Context Time Series Tasks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T06:21:42.394251Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2603.22586"},"observation_digest":"sha256:c8dad6f665c9be4c4753ee40b8a6a46914a47e5c1ab2c5608b98ac1447e977d7","observation_id":"dbebe238-8cd8-40ca-8c52-cc3e97245e66","resolution":{"observed_at":"2026-05-15T06:25:07.710016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2604.18603","last_updated":"2026-04-09T19:32:11Z","snapshot_observed_at":"2026-08-11T12:41:21.337306Z","submitted_at":"2026-04-09T19:32:11Z","title":"Dual Triangle Attention: Effective Bidirectional Attention Without Positional Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:43.716813Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2604.18603"},"observation_digest":"sha256:27c4508ea68075c6c6089f96b7e243615964578386efde1a4a633bbe73c3bc2e","observation_id":"cc8cd4cc-44e2-4e39-9a9e-1e6b85392283","resolution":{"observed_at":"2026-05-10T21:20:51.638374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2604.18827","last_updated":"2026-04-20T20:46:46Z","snapshot_observed_at":"2026-07-06T23:05:35.374092Z","submitted_at":"2026-04-20T20:46:46Z","title":"OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T02:43:25.842048Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2604.18827"},"observation_digest":"sha256:b8224524dacd8a9a204a15914ddba23dbf0dbf94eafa356fc5b842b743045707","observation_id":"5f0ca977-0fce-4456-aee5-387ace545b58","resolution":{"observed_at":"2026-05-11T12:51:04.780449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-14T09:47:58.113083Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:1ec3cb2730638b21d2ae145b947febf55e829f9c3a83c7b6baae1b8d3a10dee3","observation_id":"2ee66109-20c5-4638-8d77-35b795b06a43","resolution":{"observed_at":"2026-05-20T20:03:43.848068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2605.31485","last_updated":"2026-05-29T16:08:49Z","snapshot_observed_at":"2026-08-08T01:40:46.031663Z","submitted_at":"2026-05-29T16:08:49Z","title":"Graphical einops: bridging tensor networks and computation graphs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:59:22.892338Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2605.31485"},"observation_digest":"sha256:38aeab6f3bcf454185510b375aeec470584f169bffbe4598edae45f9b7ab0e28","observation_id":"406fdc27-22b7-4e10-b1f7-470c2cc7b495","resolution":{"observed_at":"2026-06-28T23:02:46.401271Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2606.25156","last_updated":"2026-08-12T09:48:23Z","snapshot_observed_at":"2026-08-15T08:09:33.112155Z","submitted_at":"2026-06-23T20:43:51Z","title":"ATMA: Long-Context Language Modeling via Polar Attention and Gated-Delta Compression Memory","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-25T23:52:52.985532Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2606.25156"},"observation_digest":"sha256:cd5ea47605b9e6083c012eb2e632550f0249f36208a2542722750c97db184abb","observation_id":"1c936d0b-22a4-4f5b-a87f-f560a3ab5e1c","resolution":{"observed_at":"2026-07-04T17:09:59.040282Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":"2203.16634","doi":"10.48550/arxiv.2203.16634","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.16634 , year=","venue":"arXiv (Cornell University)","work_id":"4ec68a0c-1f00-40be-8d28-278f90317c49","year":2022},"citing_paper":{"arxiv_id":"2606.25156","last_updated":"2026-08-12T09:48:23Z","snapshot_observed_at":"2026-08-15T08:09:33.112155Z","submitted_at":"2026-06-23T20:43:51Z","title":"ATMA: Long-Context Language Modeling via Polar Attention and Gated-Delta Compression Memory","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T09:38:43.250420Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2606.25156"},"observation_digest":"sha256:788fd5f4c44be87ec172ed4a71be8a79351c3c97d054a0b5d3b40ac20b8aceb4","observation_id":"294b3462-0143-4891-9b6a-262638e79ea3","resolution":{"observed_at":"2026-06-30T09:44:37.728642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-02T12:17:16.288746Z","title":"org/CorpusID:268357635","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19363","last_updated":"2026-07-27T17:19:01Z","snapshot_observed_at":"2026-08-13T10:57:12.789401Z","submitted_at":"2026-06-05T05:09:15Z","title":"AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:16.288746Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2607.19363"},"observation_digest":"sha256:381073cb1028662e00c21ea93e50aa42bf70c62a9585a70fb11a9541a5e5eb73","observation_id":"f60ed161-8f99-4c5a-b349-f1fd494fed80","resolution":{"observed_at":"2026-08-02T12:17:16.288746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.16634/citation-record","integrity":"/paper/2203.16634/integrity","json":"/paper/2203.16634/citation-record.json","paper":"/paper/2203.16634"},"outbound":[],"paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T16:12:12.278715Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2203.16634."}