{"as_of":"2026-08-17T18:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab9edbcbf4c28649e0a593917b1a16941da40cb835f80b457b97fd56f0099f7d","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:11:14.757058Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:14:11.793614Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:06:24.646981Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"cited_work":{"arxiv_id":"2507.16676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16676","snapshot_observed_at":"2026-07-02T01:06:24.646981Z","title":"Custom algorithm-based fault tolerance for attention layers in transformers.arXiv:2507.16676, 2025","venue":null,"work_id":"5024afe9-9b4c-4e53-a8d4-c6b4587b2586","year":2025},"citing_paper":{"arxiv_id":"2606.02430","last_updated":"2026-06-01T16:04:51Z","snapshot_observed_at":"2026-08-07T20:16:33.113391Z","submitted_at":"2026-06-01T16:04:51Z","title":"Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T12:36:23.320194Z"},"links":{"cited_paper":"/paper/2507.16676","citing_paper":"/paper/2606.02430"},"observation_digest":"sha256:ff6c1b5c19b21376219cd252bf749bf61900dcb6a766c62225a7815d6b82fba2","observation_id":"5ada3721-6945-4e6a-a34f-318d1719c932","resolution":{"observed_at":"2026-07-02T01:06:24.648870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"cited_work":{"arxiv_id":"2507.16676","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16676","snapshot_observed_at":"2026-07-02T01:06:24.646981Z","title":"Custom algorithm-based fault tolerance for attention layers in transformers.arXiv:2507.16676, 2025","venue":null,"work_id":"5024afe9-9b4c-4e53-a8d4-c6b4587b2586","year":2025},"citing_paper":{"arxiv_id":"2606.27934","last_updated":"2026-06-26T10:26:50Z","snapshot_observed_at":"2026-07-07T00:02:04.432452Z","submitted_at":"2026-06-26T10:26:50Z","title":"Self-Verifying Measurement Records: Hash-Linked Evidence Graphs for Hardware Benchmarking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T04:14:11.793614Z"},"links":{"cited_paper":"/paper/2507.16676","citing_paper":"/paper/2606.27934"},"observation_digest":"sha256:6b95e307c851ac531a3fb0e93f68ac23163161c891ba31bac7845d4dfb05ee96","observation_id":"6658f018-4ac8-44a5-ac88-3c0f9c2152f5","resolution":{"observed_at":"2026-07-01T17:05:50.955968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16676/citation-record","integrity":"/paper/2507.16676/integrity","json":"/paper/2507.16676/citation-record.json","paper":"/paper/2507.16676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.252536Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"e3749386-7414-4c69-8731-df83ace55305","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:12.856969Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:2a7375d0ecd11352bc596d004eb4ae3a99797c26b26baf9f22b3ad8c33331179","observation_id":"1726cef6-75a7-4ce1-837c-824687e063c7","resolution":{"observed_at":"2026-08-06T15:11:15.258961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:11:12.939944Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:12.939944Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:5f48856ff33bdf838c25d7c30cfb378f0bdc3e40cadf07ce628ba7fce7e20ed9","observation_id":"4da5dd94-c367-4018-ba04-582409e69339","resolution":{"observed_at":"2026-08-06T15:11:12.939944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.236914Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"51636202-62e2-41aa-a97d-e20afa87df07","year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:12.994346Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:8b740c9f722472ba0b43730b38e4fcebd39e76465eb3eb317ee039ceb40dee25","observation_id":"a1afa995-413d-4e94-b78c-a71235cd3281","resolution":{"observed_at":"2026-08-06T15:11:15.241717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:13.029505Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.029505Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:8d50ef210a30c48e24536c92b9dfd2153a92c41168ec082ede5dfdb10ec0daa5","observation_id":"20d921e8-6919-4c0d-9d9e-0a0a27c4412e","resolution":{"observed_at":"2026-08-06T15:11:13.029505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.208958Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"75ed23c6-3c2c-4429-8eb4-c994ff5dfd46","year":2019},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.142377Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:a358fb7430cb6c028a965188b775360ff4175471cde9338e6dabef4c9bf784b5","observation_id":"a09977e7-0f39-4512-bbe8-e4077bc9fbe9","resolution":{"observed_at":"2026-08-06T15:11:15.213824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.184180Z","title":"ALBERT: A lite bert for self-supervised learning of language represen- tations,","venue":null,"work_id":"6fbf7682-5ed2-4577-9762-8f05402ecca1","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.230159Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:6ed1437f5cb835bf3ee507012a7339e768225229fd17bef6fe87c0e608f2053f","observation_id":"2a891ef4-de55-4400-92cc-4e2116c50824","resolution":{"observed_at":"2026-08-06T15:11:15.195794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T15:11:13.311438Z","title":"Longformer: The long- document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.311438Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:74e0184b4530e439cdf1550321b589f815a0be13bb23f9cf2002894b740935a6","observation_id":"1537dfb6-9156-4d47-bb92-c1090cd701a8","resolution":{"observed_at":"2026-08-06T15:11:13.311438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T15:11:13.465021Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.465021Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:c5f43d3191627e3e4d940248c1f3b9fd87f3fca99ab633acf72f63b90ad60e94","observation_id":"67ea9787-9010-4110-b306-2a138b8e6fe1","resolution":{"observed_at":"2026-08-06T15:11:13.465021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.169604Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":"9ff918a9-c346-4e60-b955-ffc3b7753bf2","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.606383Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:e9b3cf4b30dc22ce4616be2e6a8c4cedbabe25927aaeb1584280cfbc109bda0a","observation_id":"c3642d0b-c345-4a11-bca0-c8daf9967d3b","resolution":{"observed_at":"2026-08-06T15:11:15.174047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T15:11:13.710772Z","title":"Linformer: Self-attention with linear complexity,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.710772Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:140724664cd9279505415712463296fc8fc8e690656579a4bad7b43a79cc1593","observation_id":"2b1bdcbb-ad84-4906-8dea-3dd5314f9036","resolution":{"observed_at":"2026-08-06T15:11:13.710772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.155182Z","title":"Flashattention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":"dd23ec3a-6dc0-403f-9044-04828931cee5","year":2022},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.849399Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:3bc1fc93199278da0be92d6f5e4167d462184a180156b8911b6704f7b2084d72","observation_id":"e2a02d83-144b-4fc3-805c-e5fa7ff7d6b0","resolution":{"observed_at":"2026-08-06T15:11:15.159661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T15:11:13.979517Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:13.979517Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:84f5660553efb7c5d6bffdfffea0e964cadd9c249f4f750e1300c1c48b64982a","observation_id":"224d45e6-ed93-4230-ba39-554804dfef5c","resolution":{"observed_at":"2026-08-06T15:11:13.979517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-16T17:35:33.791591Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-06T15:11:14.081783Z","title":"Self-attention does not need O(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.081783Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:180072cc6b9323bf24cf535eecc005e4820e71131df80ba19b1ca25e54b35c05","observation_id":"638ae11d-b20d-40e9-b01c-805952011d9b","resolution":{"observed_at":"2026-08-06T15:11:14.081783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.142318Z","title":"Testability and dependability of ai hardware: Survey, trends, challenges, and perspectives,","venue":null,"work_id":"d5e063a4-7754-4536-afcf-94d1eb045f28","year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.223539Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:b610e70ce1efa02f4eb78910b402479a49c4cd3cd5dcfb0af080ff4bb4fdc461","observation_id":"f871cac0-fd3d-409c-915f-bb332ca2a661","resolution":{"observed_at":"2026-08-06T15:11:15.146191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.128958Z","title":"Radiation-induced soft errors in advanced semiconductor technologies,","venue":null,"work_id":"aa91c087-8004-4b3f-b6bc-be403559131a","year":2005},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.334947Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:c99359ead6c42c960caef616fedd6f3e920790f19eaa3ce18f2afce828b4657a","observation_id":"71bc6a85-2426-4b23-83df-16ba079075cb","resolution":{"observed_at":"2026-08-06T15:11:15.133086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.113365Z","title":"Designing reliable systems from unreliable components: the challenges of transistor variability and degradation,","venue":null,"work_id":"cbb46d10-81f3-4caf-9021-b4c6973438dc","year":2005},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.499102Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:0ce03f06777467cd7a138c03aa4a30364a0b1b5bc09f06f9e1570de9aa881da8","observation_id":"7ca68cc3-8aee-44dc-b5f6-ffa33f6aa9dc","resolution":{"observed_at":"2026-08-06T15:11:15.118044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.099524Z","title":"Koren and C","venue":null,"work_id":"59e24fd0-967b-48a9-aeba-0832f344d619","year":2020},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.643518Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:46ea96f72c96581e3d279983a6b9aa23e1c0bffdfabcf79de2dd7cd38d5df1f6","observation_id":"ee666352-902a-450a-bdd1-06b1f0d9933f","resolution":{"observed_at":"2026-08-06T15:11:15.103951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.085144Z","title":"Algorithm-based fault tolerance for matrix operations,","venue":null,"work_id":"b129a76a-65fd-4dbc-b0f1-05ce469c48cd","year":1984},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.700405Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:0d25eff51d3689ba7fe8eb232ea2438157b2fcb5be127afc7b28ff791df03291","observation_id":"0cbad548-a087-4880-8e34-edd838c1435d","resolution":{"observed_at":"2026-08-06T15:11:15.089713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.069412Z","title":"Towards practical algorithm based fault tolerance in dense linear algebra,","venue":null,"work_id":"478d398c-23bc-4ac8-8d56-0cd2d86071ea","year":2016},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.704838Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:7df064234c7aec03d141f14e55519f27a9f2edebaa1b456631a363d7131180df","observation_id":"7bb21ce6-8621-46fb-a2d0-12c872287a08","resolution":{"observed_at":"2026-08-06T15:11:15.074743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.055623Z","title":"Low-cost online convolution checksum checker,","venue":null,"work_id":"87b7810b-0072-4449-af1d-0bab7f56c913","year":2022},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.708914Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:47d0d4ce3566bf71f3459789101008fa0f0c6a02a2761ed03aab2b75df4f0d9f","observation_id":"e996bb4f-9dc7-4655-bc83-9b40101f8eac","resolution":{"observed_at":"2026-08-06T15:11:15.059694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.041952Z","title":"Making convolutions resilient via algorithm-based error detection techniques,","venue":null,"work_id":"76969715-4295-4a70-b936-ac4a2ddd22eb","year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.713172Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:591664cdc3547011d283a5dee1f1647f1a8bad65015422d3149bc4f9632b040a","observation_id":"36c45af1-b32d-4f3d-a4bb-903cd44c9458","resolution":{"observed_at":"2026-08-06T15:11:15.046116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.028140Z","title":"GCN-ABFT: Low-cost online error checking for graph convolutional networks,","venue":null,"work_id":"a8bc35ff-ab05-49ff-a949-312f8383a62e","year":2025},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.717974Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:6a89596c297d142529b64cb4778391a72d061f96f4d2ce2f97fa59884a7a937e","observation_id":"191a8307-dc79-4808-9aa7-2b79db652095","resolution":{"observed_at":"2026-08-06T15:11:15.032332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10469","last_updated":"2025-04-21T02:17:47Z","snapshot_observed_at":"2026-08-16T15:53:55.452106Z","submitted_at":"2023-02-21T06:21:28Z","title":"ApproxABFT: Approximate Algorithm-Based Fault Tolerance for Neural Network Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10469","snapshot_observed_at":"2026-08-06T15:11:14.722039Z","title":"Approxabft: Approximate algorithm-based fault tolerance for neural network pro- cessing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.722039Z"},"links":{"cited_paper":"/paper/2302.10469","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:61140de859ead0d66ee8f228620b26fc18b3196a47e55d8b729d371d1afada0d","observation_id":"cd30ca60-d1c9-4606-802d-66762c458f80","resolution":{"observed_at":"2026-08-06T15:11:14.722039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:15.012391Z","title":"ATTNChecker: Highly-optimized fault tolerant attention for large language model train- ing,","venue":null,"work_id":"2e509cc9-6125-4026-a3d1-e94772d294fb","year":2025},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.726171Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:de9bb32c5b8471cbbc94f94945c968dedc97309d3559510b28a4e5d8127b7c14","observation_id":"8023e98d-5b9e-4789-aca6-5a691cffcec9","resolution":{"observed_at":"2026-08-06T15:11:15.017561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.993738Z","title":"Error resilient transformers: A novel soft error vulnerability guided approach to error checking and suppression,","venue":null,"work_id":"97b40999-760c-40a5-893d-210e1b2dc86e","year":2023},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.730302Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:31782fc913b395e332f3c4037e608dd18f79572865bb34f8cc05464e281d4f31","observation_id":"5d8a004a-ae2c-4111-9990-a4fac118f290","resolution":{"observed_at":"2026-08-06T15:11:14.998636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.979361Z","title":"Language models are unsupervised multitask learn- ers,","venue":null,"work_id":"98463836-5fee-448c-b049-96d62340c2c3","year":2019},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.734026Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:bc4fb5fdbd4c9f2d607447035c7356d4f1675bbf6ed969934333012a0769d77c","observation_id":"aa88b97b-615f-45d0-9b79-48bd054a1690","resolution":{"observed_at":"2026-08-06T15:11:14.983410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.965792Z","title":"Attention is all you need,","venue":null,"work_id":"c5b5881d-3f7d-4630-a348-dad3c26185d5","year":2017},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.738353Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:8f9948b090d404fa03fe408f71b2a4aff5e4799d31d757013602b4725976212f","observation_id":"11c98e64-7fa8-4204-b16c-3efb622cb0ab","resolution":{"observed_at":"2026-08-06T15:11:14.969704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.951048Z","title":"Mnnfast: a fast and scalable system architecture for memory-augmented neural networks,","venue":null,"work_id":"169b789d-f898-4c15-9103-d7cf62901666","year":2019},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.742149Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:16d85f0b7efeefcaa00b899ca5058e8d7c4a5e4335c1e4d4ad8d85cc4dbf9140","observation_id":"d201a12b-bd95-42cb-ba83-5c45b9d0acbc","resolution":{"observed_at":"2026-08-06T15:11:14.955836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-08-14T19:17:44.982420Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-06T15:11:14.746427Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.746427Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:70adcd33b3ca5ec536c3b053c3761239f83e2edd23bf057b330c5e694c564514","observation_id":"7d34483d-868d-4fac-a524-80541c150029","resolution":{"observed_at":"2026-08-06T15:11:14.746427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T15:11:14.752400Z","title":"Huggingface’s trans- formers: State-of-the-art natural language processing,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.752400Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:04062886dd7855eac19638fd9177430e66bfe5b9d29fc2e19bb72b0f5c71231f","observation_id":"b25e2d2f-7a4a-4b63-a6d5-3c82c9e06d6b","resolution":{"observed_at":"2026-08-06T15:11:14.752400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:11:14.933940Z","title":"Automatic detection of floating- point exceptions,","venue":null,"work_id":"9aa33874-d727-4436-8762-e177f9978d1a","year":2013},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.757058Z"},"links":{"citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:fccf75eed5179848745c8bcb0f55b9d982d5b7e9a97bebaa6b487f53d08cb50a","observation_id":"8973ae6c-3569-4362-b91e-d8841794b4e3","resolution":{"observed_at":"2026-08-06T15:11:14.940425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T03:58:40.305354Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2507.16676."}