{"as_of":"2026-08-11T09:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31bc4978374a306e30dd5267f3904672431cdff71dc535196c6376557ec4b456","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:07:54.928227Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.15665/citation-record","integrity":"/paper/2501.15665/integrity","json":"/paper/2501.15665/citation-record.json","paper":"/paper/2501.15665"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.776115Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.776115Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:f9a969f4f7398398a2412c99ef3fbc86f6df116fa1adafc93be8deb19ac17f36","observation_id":"a0e66b9c-320e-4572-9d9b-7b9b0e0d9a75","resolution":{"observed_at":"2026-08-10T14:07:54.776115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:55.347541Z","title":"Alternating updates for efficient transformers","venue":null,"work_id":"0396a7e8-c46f-4dc0-9fe9-37df3daf6471","year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.780759Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:36bf71cf6f764c655cc7c19603fcf708de2ccb42de918cb3d515699d3dc01092","observation_id":"bd3e6ade-3f2f-462c-83f4-feeb0cacfafa","resolution":{"observed_at":"2026-08-10T14:07:55.351139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-10T14:07:54.784407Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.784407Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:f2fc0019e6bb14ae8e5e49deef450d443082321320ed15dec8c7297e551f8ea4","observation_id":"7cdf6467-f0f1-43fa-a879-4f6a6225a36a","resolution":{"observed_at":"2026-08-10T14:07:54.784407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T14:07:54.788205Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.788205Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:6691320bedc36220cb1824ecf5db38e8b6ee64cb83cd5055c46917e68623241e","observation_id":"3af2e5f1-3689-40f4-8a95-d4d050f2bfea","resolution":{"observed_at":"2026-08-10T14:07:54.788205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-10T14:07:54.791794Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.791794Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:c377aeeeaa43562f59bf04d9f3c94fc2aeb5981421aea0dd552e0b5333358529","observation_id":"fc58b6e2-e853-447c-9916-d696ac9823fe","resolution":{"observed_at":"2026-08-10T14:07:54.791794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-10T14:07:54.795686Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.795686Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:3b1aebdce34ee4e18e07e2b693ff72eada431eacc331404e413b791013bf0648","observation_id":"974c6af0-8261-4366-a204-73bc090c39b9","resolution":{"observed_at":"2026-08-10T14:07:54.795686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02860","last_updated":"2019-06-02T21:21:48Z","snapshot_observed_at":"2026-07-06T07:25:48.468658Z","submitted_at":"2019-01-09T18:28:19Z","title":"Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.02860","snapshot_observed_at":"2026-08-10T14:07:54.799312Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.799312Z"},"links":{"cited_paper":"/paper/1901.02860","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:70213bcfcf57e4e4d2b0fe746dfe9cb5b106f24f11dea31b13a67912535c1c52","observation_id":"377ca7f2-7c8b-40af-a137-d74c7bee3476","resolution":{"observed_at":"2026-08-10T14:07:54.799312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-10T14:07:54.803445Z","title":"Universal transformers","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.803445Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:52d217ebc80bc4a8801170b65e3bda7b6cec6546a1f1ae17007c99891b2e0440","observation_id":"d68fe441-3366-47e0-b7bc-4876fc4334cc","resolution":{"observed_at":"2026-08-10T14:07:54.803445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T14:07:54.807031Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.807031Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:e87f21048527c18db2925c4a4af527b99597cc3cfd4568b695d6fbf27d3ba12d","observation_id":"4f82287a-7ece-475a-9fda-5da9564be803","resolution":{"observed_at":"2026-08-10T14:07:54.807031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-10T14:07:54.810466Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.810466Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:6cd28211a54bff3f43fc8137e29a775598115e3a9b0da542e8967d4becee3dd2","observation_id":"9e20f0e0-afa4-4fb7-aafe-e9e571ac21d3","resolution":{"observed_at":"2026-08-10T14:07:54.810466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:55.336881Z","title":"Reddi, Stefanie Jegelka, and Sanjiv Kumar","venue":null,"work_id":"c9acb9de-d756-45bd-9977-a40c09620ab8","year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.814110Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:de9209bdb590e7e019a7d94914c6ebe6dc506aafce7bd7838a178ba9635e3b10","observation_id":"cbc83045-0a1c-4cad-bec6-1e2e67509c20","resolution":{"observed_at":"2026-08-10T14:07:55.340373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13196","last_updated":"2023-01-30T18:57:31Z","snapshot_observed_at":"2026-07-06T14:46:15.598295Z","submitted_at":"2023-01-30T18:57:31Z","title":"Looped Transformers as Programmable Computers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13196","snapshot_observed_at":"2026-08-10T14:07:54.817234Z","title":"Lee, and Dimitris Papailiopoulos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.817234Z"},"links":{"cited_paper":"/paper/2301.13196","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:4fedff0caa79803d8a83a0a63c0c0c8fbb1758c7fa1765e106dbde0a7a32e975","observation_id":"81d576bc-4f69-483a-b316-dd2e89164723","resolution":{"observed_at":"2026-08-10T14:07:54.817234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-10T14:07:54.820921Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.820921Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:1ceb085767b5d40edb28d5342ce1a036262078c5efa4604336ac6d80f04585b1","observation_id":"615d72f9-6afb-491e-a5ee-ae8f3691df54","resolution":{"observed_at":"2026-08-10T14:07:54.820921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-10T14:07:54.824603Z","title":"Efficiently modeling long sequences with structured state spaces, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.824603Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:349324f760ec3f7fb97e506bb16654119f525b887201ff6de89045537dd474b6","observation_id":"ca3b9ef9-da3f-44f6-a784-2f276d87ba7f","resolution":{"observed_at":"2026-08-10T14:07:54.824603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T14:07:54.828119Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.828119Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:723e58eb2ffbe2ec0421b702a3a4540c1abe4d0ea9ada5155933645cb90dca82","observation_id":"8469b359-4ada-4fec-9918-50f6dfec981b","resolution":{"observed_at":"2026-08-10T14:07:54.828119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07852","last_updated":"2022-11-02T00:35:56Z","snapshot_observed_at":"2026-08-11T02:34:12.956164Z","submitted_at":"2022-03-11T23:44:33Z","title":"Block-Recurrent Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07852","snapshot_observed_at":"2026-08-10T14:07:54.831688Z","title":"Block-recurrent transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.831688Z"},"links":{"cited_paper":"/paper/2203.07852","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:d96d0df4779deb6f31f0ecd1899f862fa0923b84f4d66c5ee217ef7f322eb97f","observation_id":"10fb57b7-ceee-4260-ba51-c6762f382a86","resolution":{"observed_at":"2026-08-10T14:07:54.831688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:55.326315Z","title":"Staircase attention for recurrent processing of sequences","venue":null,"work_id":"532db695-a0a5-4da7-b1d6-5c410276cfab","year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.835138Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:1c0b6b1c926f55f3dc820995e932e165f4a18894cfc329e1bcdd7a4b8413b39c","observation_id":"385ab400-1d8a-4253-a85e-1dd08ae8c4d3","resolution":{"observed_at":"2026-08-10T14:07:55.329946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.838413Z","title":"Matryoshka representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.838413Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:9c64e08f31dc0b1da592fa8b74dc9ba0ff6d51fac33485600dc8a9d29100d083","observation_id":"4fdc8c48-23b5-4b66-9e77-eee7e6b37287","resolution":{"observed_at":"2026-08-10T14:07:54.838413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-10T14:07:54.842358Z","title":"Albert: A lite bert for self-supervised learning of language representations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.842358Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:4a0e5332be03ca7ecafed9c68073c1d822e4f8f52ec902ffc597adb810dd95de","observation_id":"83bb5f49-fc43-458d-a238-f9934cce98b4","resolution":{"observed_at":"2026-08-10T14:07:54.842358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-10T14:07:54.845629Z","title":"Fast inference from transformers via speculative decoding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.845629Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:5df3fe5c124ce93cc70d3d74ab4bff38e5f1374340d3f61cd997a3074abf9e2e","observation_id":"523fb696-6b63-42a7-ae71-4ca8d65db7a2","resolution":{"observed_at":"2026-08-10T14:07:54.845629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04679","last_updated":"2023-08-09T03:18:07Z","snapshot_observed_at":"2026-08-08T04:16:00.017790Z","submitted_at":"2023-08-09T03:18:07Z","title":"Sci-CoT: Leveraging Large Language Models for Enhanced Knowledge Distillation in Small Models for Scientific QA","version":1},"cited_work":{"arxiv_id":"2308.04679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.04679","snapshot_observed_at":"2026-08-10T14:07:55.102601Z","title":"Sci-CoT: Leveraging Large Language Models for Enhanced Knowledge Distillation in Small Models for Scientific QA","venue":"cs.CL","work_id":"c0f28fa9-6848-42d9-8a24-816ae98a65e3","year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.849092Z"},"links":{"cited_paper":"/paper/2308.04679","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:dad71d499495a5a06d07a44dfbec72f3a631423371a7e9d8e1f210fd1fb54254","observation_id":"edfdfc48-336b-489d-a50c-756824a205b6","resolution":{"observed_at":"2026-08-10T14:07:55.108850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05913","last_updated":"2024-10-13T19:35:21Z","snapshot_observed_at":"2026-08-08T23:15:41.966258Z","submitted_at":"2024-02-08T18:49:09Z","title":"Efficient Stagewise Pretraining via Progressive Subnetworks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05913","snapshot_observed_at":"2026-08-10T14:07:54.852512Z","title":"Efficient stagewise pretraining via progressive subnetworks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.852512Z"},"links":{"cited_paper":"/paper/2402.05913","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:6c2b93dabf8703f725c6b60ffd55d65ea28d3635463b72b4026a5f584f2c64e1","observation_id":"cf4e5b96-821d-4b41-a86e-232cf7f3ce8a","resolution":{"observed_at":"2026-08-10T14:07:54.852512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05102","last_updated":"2022-11-09T18:50:38Z","snapshot_observed_at":"2026-08-06T17:49:15.224623Z","submitted_at":"2022-11-09T18:50:38Z","title":"Efficiently Scaling Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05102","snapshot_observed_at":"2026-08-10T14:07:54.856058Z","title":"Efficiently scaling transformer inference, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.856058Z"},"links":{"cited_paper":"/paper/2211.05102","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:273f9882fc53071b4b4d19a176e1953d2b55c5fa5cab7d6708203fa5b240bc86","observation_id":"6dfb7b8e-396e-40ef-bcd6-772041024548","resolution":{"observed_at":"2026-08-10T14:07:54.856058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.859530Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.859530Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:e907ba68012385c18d669ad8ac7ac91d87006f61cae1495ccc860365627aef92","observation_id":"88ac6e82-cd6f-4cf1-bbda-2c44b32fa343","resolution":{"observed_at":"2026-08-10T14:07:54.859530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-10T14:07:54.862703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.862703Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:5e9d48d1a6e95f7c636df52fc6456c814a3cd95480581810ea1601fda011c47e","observation_id":"88efe3e7-cdf2-460d-8ee0-07c2e55cc399","resolution":{"observed_at":"2026-08-10T14:07:54.862703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03822","last_updated":"2018-06-11T06:10:11Z","snapshot_observed_at":"2026-08-10T03:45:00.871928Z","submitted_at":"2018-06-11T06:10:11Z","title":"Know What You Don't Know: Unanswerable Questions for SQuAD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03822","snapshot_observed_at":"2026-08-10T14:07:54.866116Z","title":"Know what you don't know: Unanswerable questions for squad, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.866116Z"},"links":{"cited_paper":"/paper/1806.03822","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:861f1fc4effa7f0855101a6c3a7e101ebc073c61418e7c4cc00027f0511a8a41","observation_id":"8c5aa30e-95d6-42a8-8a22-dea4f1cec7bd","resolution":{"observed_at":"2026-08-10T14:07:54.866116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-10T14:07:54.869770Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.869770Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:7f1cd06fd3799961486853852ca8f6d0e46bf8d2ee1706f83b612edf6a1863d1","observation_id":"a6715e60-9074-415a-8e31-0023ca83e24f","resolution":{"observed_at":"2026-08-10T14:07:54.869770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10427","last_updated":"2023-05-17T17:57:34Z","snapshot_observed_at":"2026-07-06T15:28:49.253125Z","submitted_at":"2023-05-17T17:57:34Z","title":"Accelerating Transformer Inference for Translation via Parallel Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10427","snapshot_observed_at":"2026-08-10T14:07:54.873042Z","title":"Accelerating transformer inference for translation via parallel decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.873042Z"},"links":{"cited_paper":"/paper/2305.10427","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:661af4432bff10415c1d7971f42016986e39765257c6960d26c36a5670fdbc89","observation_id":"236409e3-b836-469d-b554-53637fc8ea9f","resolution":{"observed_at":"2026-08-10T14:07:54.873042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17416","last_updated":"2025-02-24T18:49:05Z","snapshot_observed_at":"2026-08-07T17:52:21.542087Z","submitted_at":"2025-02-24T18:49:05Z","title":"Reasoning with Latent Thoughts: On the Power of Looped Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17416","snapshot_observed_at":"2026-08-10T14:07:54.876877Z","title":"Reasoning with latent thoughts: On the power of looped transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.876877Z"},"links":{"cited_paper":"/paper/2502.17416","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:9a2ba4e4dd59d15e6400df1f3cf712980b5b6175f5aec552b31007c635310c26","observation_id":"9991db73-6541-42d0-85bf-78d834a577fb","resolution":{"observed_at":"2026-08-10T14:07:54.876877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.03115","last_updated":"2018-11-07T19:09:40Z","snapshot_observed_at":"2026-08-11T01:49:32.059098Z","submitted_at":"2018-11-07T19:09:40Z","title":"Blockwise Parallel Decoding for Deep Autoregressive Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.03115","snapshot_observed_at":"2026-08-10T14:07:54.880394Z","title":"Blockwise parallel decoding for deep autoregressive models, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.880394Z"},"links":{"cited_paper":"/paper/1811.03115","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:ea0aa60a6a7c11378e41bc534dbaf4b054dedfa49b76e36bd01972009bba3300","observation_id":"1212362c-9cca-4ea2-bfc2-a8643b658ccb","resolution":{"observed_at":"2026-08-10T14:07:54.880394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-10T14:07:54.883925Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.883925Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:c1d44b8881a7247aff3d0aad8767add3680f5cbca812cc4099f7dc68ae8c1c04","observation_id":"3f461045-4b9e-4f8f-a225-8bd229dd4a66","resolution":{"observed_at":"2026-08-10T14:07:54.883925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.887481Z","title":"Spectr: Fast speculative decoding via optimal transport","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.887481Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:968c705937f31baf8d264eeeed654be3ba424b693ff13c766cde14307fefab6e","observation_id":"075177f1-209e-4200-a319-0728bdbd9fb1","resolution":{"observed_at":"2026-08-10T14:07:54.887481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06732","last_updated":"2022-03-14T10:35:35Z","snapshot_observed_at":"2026-08-10T04:20:43.440597Z","submitted_at":"2020-09-14T20:38:14Z","title":"Efficient Transformers: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.06732","snapshot_observed_at":"2026-08-10T14:07:54.890675Z","title":"Efficient transformers: A survey, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.890675Z"},"links":{"cited_paper":"/paper/2009.06732","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:34c6f64431e1dd2a2d5e41b00bc0864cd4538915f00c0dff3498b14cba6dcb4b","observation_id":"6c7f9a87-26f3-4ac1-84e1-ed6e3b949461","resolution":{"observed_at":"2026-08-10T14:07:54.890675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:55.297459Z","title":"Attention is all you need","venue":null,"work_id":"d4a2f078-7abe-4241-b1e2-6c04b3946d6a","year":2017},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.893995Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:74dd691aa226722aaf6ec46dd3ea80540332eece748505f2fe66078a0e22b3a7","observation_id":"bef9b9e5-d0a3-4a01-b572-63320d408d61","resolution":{"observed_at":"2026-08-10T14:07:55.300946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00537","last_updated":"2020-02-13T00:28:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-05-02T00:41:50Z","title":"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00537","snapshot_observed_at":"2026-08-10T14:07:54.897335Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.897335Z"},"links":{"cited_paper":"/paper/1905.00537","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:685cd651abf878458556dc9e88962e89d3751b2727daa5fc4d7a14a3ec90f5bc","observation_id":"1a9fe3df-ce19-450c-9e8f-b2c6d031e535","resolution":{"observed_at":"2026-08-10T14:07:54.897335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.900623Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.900623Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:d9a1a1be728e5972bbb67e798e5e3f31ff254056a933a25c1401354b140e6c8e","observation_id":"ed3f6520-fadc-4424-a824-15cfbed0702f","resolution":{"observed_at":"2026-08-10T14:07:54.900623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-10T14:07:54.903899Z","title":"A survey on knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.903899Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:f0be61705324f40ff8687dbddd9c27e05fe8d465429127125b9cd424c7799261","observation_id":"18e071fe-10f2-4d4d-9791-71ddaca1d093","resolution":{"observed_at":"2026-08-10T14:07:54.903899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-10T14:07:54.907468Z","title":"Gspmd: General and scalable parallelization for ml computation graphs, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.907468Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:1f2c1312cc9b1f70da2ef73416155de23abbb66348b940ef1cb51122f61a87d8","observation_id":"302c333b-1e1b-4b64-9afd-d34d36425c90","resolution":{"observed_at":"2026-08-10T14:07:54.907468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20311","last_updated":"2024-07-29T17:52:40Z","snapshot_observed_at":"2026-07-06T18:53:35.627045Z","submitted_at":"2024-07-29T17:52:40Z","title":"Physics of Language Models: Part 2.1, Grade-School Math and the Hidden Reasoning Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20311","snapshot_observed_at":"2026-08-10T14:07:54.910904Z","title":"Physics of language models: Part 2.1, grade-school math and the hidden reasoning process","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.910904Z"},"links":{"cited_paper":"/paper/2407.20311","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:5167adc434081885b8f2c94d700466bce1c93f3a8de4234fe21153d3066ef449","observation_id":"2ae45bdc-aad4-4d97-87ec-d5af3b0802d1","resolution":{"observed_at":"2026-08-10T14:07:54.910904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T14:07:54.914225Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.914225Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:a65cc1fbc8d754bb582c4e049e5766831da356b4aaab85df3de148298d41f414","observation_id":"b4212862-6f12-4e46-91f3-77a45fa41676","resolution":{"observed_at":"2026-08-10T14:07:54.914225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:55.279684Z","title":"Are more layers beneficial to graph transformers? In The Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":"78141d1c-830c-4b54-84ff-3802607b491a","year":2023},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.917737Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:0a66677f08ad271cb021753692cbb5eaca38488671e6a28a384ed9b138b7d55d","observation_id":"c0f8f794-9fb6-40ae-9208-aa739cb468ff","resolution":{"observed_at":"2026-08-10T14:07:55.283956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.920828Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.920828Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:e873b47012a12ea846f31357ee4893bbc3ade31467e0431daee78179c5d81338","observation_id":"4587f681-fa76-4054-866b-1c4213117015","resolution":{"observed_at":"2026-08-10T14:07:54.920828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:54.924691Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.924691Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:2cb1b85659a3df07a177e52bc16a647242d9c905067033a4f6d45b607353cb5d","observation_id":"19aedf0e-fd07-4588-9727-f61e8b482493","resolution":{"observed_at":"2026-08-10T14:07:54.924691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:07:55.256996Z","title":"hidden state","venue":null,"work_id":"b2cbf739-aae5-4ab3-ac07-7c8003b1f375","year":null},"citing_paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T14:07:54.928227Z"},"links":{"citing_paper":"/paper/2501.15665"},"observation_digest":"sha256:b5ae1b3332239727a8b843daa9b4b1638a01a416f7066c3e2c1cb6e112c4717a","observation_id":"fdc01d97-ea75-4167-9993-bcc4f0b9710a","resolution":{"observed_at":"2026-08-10T14:07:55.260422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.15665","last_updated":"2025-08-26T15:21:49Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T21:49:15.889700Z","submitted_at":"2025-01-26T20:09:11Z","title":"StagFormer: Time Staggering Transformer Decoding for RunningLayers In Parallel"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":6},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2501.15665."}