{"as_of":"2026-08-09T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d674df5c35fa07a70f49c1c326b272555cf83a20a6bdab47f07d2cb1b5802fb","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:44.481313Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:10:40.858525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:16:00.127986Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"cited_work":{"arxiv_id":"2505.14201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14201","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alexandridis, V","venue":null,"work_id":"20e2adea-1347-4bd8-be57-f40cd0a7dc7b","year":2025},"citing_paper":{"arxiv_id":"2604.12798","last_updated":"2026-04-14T14:28:50Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:28:50Z","title":"VFA: Relieving Vector Operations in Flash Attention with Global Maximum Pre-computation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:40.858525Z"},"links":{"cited_paper":"/paper/2505.14201","citing_paper":"/paper/2604.12798"},"observation_digest":"sha256:4368cb0c1fb9f3ac97611e950b557a4f87bc584d301d898eacc1870aa0c5b315","observation_id":"639b91f1-2560-466d-88fc-4a7dfc650174","resolution":{"observed_at":"2026-05-11T09:16:00.130999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14201/citation-record","integrity":"/paper/2505.14201/integrity","json":"/paper/2505.14201/citation-record.json","paper":"/paper/2505.14201"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T15:42:41.396596Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.396596Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:82e8bc269f9db31356e12832c1c1acb1b52506ac6bb9df835d106ad822bba4e5","observation_id":"349993c8-feb5-4014-a864-1cfce29a038e","resolution":{"observed_at":"2026-08-07T15:42:41.396596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:42:41.486142Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.486142Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:aa257c9be4b9db730ab189e9bf81d14e9406b388026a280683710c931175a1aa","observation_id":"cee44612-0d29-43ac-8842-f30050447758","resolution":{"observed_at":"2026-08-07T15:42:41.486142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.775060Z","title":"Attention is all you need,","venue":null,"work_id":"f7348572-8d18-4ba3-849d-c95de0d853ab","year":2017},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.673709Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:5b4713f0b7dfbb756b88a704057f65a4ae67e321d58fae2f115ffba162ad7e05","observation_id":"7e8e00ff-03cd-4f0f-bb7f-91a51a4f3e07","resolution":{"observed_at":"2026-08-07T15:42:48.818408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-07T15:42:41.807184Z","title":"Longformer: The long- document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.807184Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:08caa1309a9f6bd59fc0eee5cb9380b4a39f08db86a90ea89eea89b806690f7d","observation_id":"7d28a434-0e31-4b99-8e28-4883668f8793","resolution":{"observed_at":"2026-08-07T15:42:41.807184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-07T15:42:41.876917Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.876917Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:64dd55b0cd579f0a36182ed0517e185d53c61f0f8b13e9a68012f91a12fbb09c","observation_id":"da553e48-38be-4b9b-9751-363622a02bb1","resolution":{"observed_at":"2026-08-07T15:42:41.876917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.614981Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":"20884f8e-8a6a-42f4-9307-7434fa7ac1b5","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:41.944105Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:6fb42487ed30a4207adcf93634f3241f0470d367ea9ee16e31de772264846d98","observation_id":"d861182a-2346-4b5d-953d-333fccd78792","resolution":{"observed_at":"2026-08-07T15:42:48.665023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04009","last_updated":"2024-02-06T14:03:15Z","snapshot_observed_at":"2026-08-09T04:56:34.945015Z","submitted_at":"2024-02-06T14:03:15Z","title":"Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2402.04009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.04009","snapshot_observed_at":"2026-08-07T15:42:44.776272Z","title":"Low-rank Attention Side-Tuning for Parameter-Efficient Fine-Tuning","venue":"cs.CV","work_id":"1323316c-fba9-4445-9eb5-875096375c3a","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.026401Z"},"links":{"cited_paper":"/paper/2402.04009","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:9127172520897515f80260418915c0a455c94f15795c76a28f54230d8dd64c4f","observation_id":"fa7d2e7a-5ab0-4d68-95f9-2bc161848ece","resolution":{"observed_at":"2026-08-07T15:42:44.866897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.325773Z","title":"A3: Accelerating attention mechanisms in neural networks with approximation,","venue":null,"work_id":"961f2b56-47c4-498e-891e-9cc98618bedd","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.109222Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:c5ea2e92570e9f40a19b0be96e2773c06f5fb4f9adc5e66f8e7781323836e0f5","observation_id":"e0b04749-b178-4e00-9827-2ec14640240c","resolution":{"observed_at":"2026-08-07T15:42:48.422976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:48.099103Z","title":"A 95.6-TOPS/W deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,","venue":null,"work_id":"675fdc43-133f-457b-bb31-504a8726f4b2","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.213076Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:34cb8965a8702e2f6a9f3c8ae3d915313880477ac79a6a089f98a5508b5b7590","observation_id":"9ddba633-3b3e-4e9a-adbc-cea455b0f1d7","resolution":{"observed_at":"2026-08-07T15:42:48.215809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.916217Z","title":"Hardware accelerator for multi-head attention and position-wise feed-forward in the trans- former,","venue":null,"work_id":"cb87c3c4-b06a-42e2-9e75-82361f137ece","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.317685Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:7f0ba689b3759e9b89d8a870872e4168774e0cd336bef554f6c5bf795b5ce132","observation_id":"c7ee989e-6d9e-4e31-be83-90ed16390a24","resolution":{"observed_at":"2026-08-07T15:42:47.975824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:42.406649Z","title":"Mnnfast: a fast and scalable system architecture for memory-augmented neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.406649Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:c8c45dc694ffdc262cad2fd0104c84611f8012708edef5d9c8f93c6092f7a04e","observation_id":"9f4355ff-8cb8-425e-a162-65cb5a70bd09","resolution":{"observed_at":"2026-08-07T15:42:42.406649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.684724Z","title":"COSA plus: Enhanced co-operative systolic arrays for attention mechanism in transformers,","venue":null,"work_id":"6885c1ac-1cd8-4209-90fd-8e80691fb147","year":2025},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.504330Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:23a04f659f2bab7d7ab9221855b0c28bade3df17ec132c5fc769b6dc109e5fcf","observation_id":"56ed8ec6-0c96-4456-91ee-eb4ee6ddd782","resolution":{"observed_at":"2026-08-07T15:42:47.793607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.359835Z","title":"ELSA: Hardware-software co-design for efficient, lightweight self- attention mechanism in neural networks,","venue":null,"work_id":"92a8897d-9dd1-4707-89f0-ddf89892b18f","year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.587501Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:0d32f948a0be51b70afbd81fb37dec7ca32df63fb1891ce0d9e187b2f76cb323","observation_id":"1fb37edb-fe37-4de3-abaa-efb49c65b383","resolution":{"observed_at":"2026-08-07T15:42:47.470310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.196878Z","title":"TSAcc: An efficient tempo-spatial similarity aware accelerator for attention acceleration,","venue":null,"work_id":"9bdbe0c3-d4c3-49a1-97fe-307879ed5df7","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.681722Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:0be87a6d015a59ac727e11027d09a445724128762403255c80c526e1b2026344","observation_id":"afb78e9b-4af3-4d79-a5f5-22c5fa03f436","resolution":{"observed_at":"2026-08-07T15:42:47.270387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:47.101146Z","title":"X-former: In-memory acceleration of transformers,","venue":null,"work_id":"ccc52804-33a8-4f6e-98c8-47cf45f7ede6","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.769494Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:8759280d9dbedb2f3552da9b2b6640108da9225d805a0039ba361186be5d3fd4","observation_id":"4f386474-4bba-4ac7-b3fc-f64ac1eb530f","resolution":{"observed_at":"2026-08-07T15:42:47.146014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:42.843511Z","title":"Flashattention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.843511Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:7d100ca4d5462d63a31383c6c7fd60b069231539591034bfb4c964e4538f7ecd","observation_id":"9fb1e344-3540-4a0e-8e48-92d009a77b53","resolution":{"observed_at":"2026-08-07T15:42:42.843511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T15:42:42.955605Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:42.955605Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:32f99ce24dbcc52f21f36d063a0eb15c46d724a30514e865b3a6d68f5eefd308","observation_id":"f153e9dd-7686-4826-9cd3-73827174f756","resolution":{"observed_at":"2026-08-07T15:42:42.955605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T15:42:43.089177Z","title":"Self-attention does not need O(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.089177Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:2491f603f4a096d5205b57717666ea88a5c2580edd94bf7729b492023e0f5294","observation_id":"d1bdae36-d87c-4e8e-bc7c-ff74eab4a9a4","resolution":{"observed_at":"2026-08-07T15:42:43.089177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.918968Z","title":"Hardware-efficient softmax approximation for self-attention networks,","venue":null,"work_id":"efeddfd1-af7e-4967-a4ff-9e0e0fc24752","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.180030Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:95faf27ed32dddcee235941e68eac2be466b25fa1b8ff0f8e282c975974c9784","observation_id":"a7f5bb64-107c-4696-89dc-2b8e594bb8b9","resolution":{"observed_at":"2026-08-07T15:42:47.014152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.731861Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"f2489270-ccf2-4f01-93eb-9d48a6694067","year":2019},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.289112Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:7b532a94bfe13cbaae72d1710521bde0ee44844f899c26d345220b377995973b","observation_id":"6ede0174-f242-48c7-9086-66d271395e83","resolution":{"observed_at":"2026-08-07T15:42:46.816425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.547243Z","title":"Fastervit: Fast vision transformers with hierarchical attention,","venue":null,"work_id":"dbde1d53-23cc-42e3-bf4c-1315cf97bf4d","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.386091Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:8311d78c8d42e9abf8f1034248fc4d7dd76534b1a9c43eddbc4b82860c71db06","observation_id":"f091fd2e-ee33-4128-9ef7-e09aa398d584","resolution":{"observed_at":"2026-08-07T15:42:46.664766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10930","last_updated":"2024-11-15T00:09:44Z","snapshot_observed_at":"2026-07-06T17:31:21.158599Z","submitted_at":"2024-01-31T17:52:52Z","title":"ConSmax: Hardware-Friendly Alternative Softmax with Learnable Parameters","version":3},"cited_work":{"arxiv_id":"2402.10930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10930","snapshot_observed_at":"2026-08-07T15:42:44.619381Z","title":"ConSmax: Hardware-Friendly Alternative Softmax with Learnable Parameters","venue":"cs.AR","work_id":"1b0d6da0-d525-4caf-9bb4-e15c655948c3","year":2024},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.511403Z"},"links":{"cited_paper":"/paper/2402.10930","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:68e4361b6726db5490e8c2b36a73f427ed9ddeda365a2aec0c3a83b081f6b95e","observation_id":"07f7228f-5b5f-473f-8d4e-b13b1718f94b","resolution":{"observed_at":"2026-08-07T15:42:44.687202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-07T15:42:43.564642Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.564642Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:294991de892b0c1cf8fa9a4b3a28c11badc7a366a6ce5b95d4695da4c21ce809","observation_id":"e64bf920-7b6b-4733-a4e8-43710b9e17ee","resolution":{"observed_at":"2026-08-07T15:42:43.564642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.388599Z","title":"Edge- BERT: sentence-level energy optimizations for latency-aware multi-task NLP inference,","venue":null,"work_id":"a5f32ffe-28af-4ad5-b625-89431066acc9","year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.672792Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:23ebc281761e8caefea9906dacc3b897947417261fbbf0993373ded7e8e7dbde","observation_id":"c8dd91a7-88e8-490a-9ad8-596a052082d9","resolution":{"observed_at":"2026-08-07T15:42:46.461527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:46.224352Z","title":"Online alignment and ad- dition in multiterm floating-point adders,","venue":null,"work_id":"d76852ae-0160-4867-86d5-fe839996fc94","year":2025},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.742667Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:42ca2e1d45980814ca9e69844aa3bda8d84ef1c7884ef78a77e29823c0f5eec2","observation_id":"c3816f74-255d-41a5-b4b9-ae90019b3b14","resolution":{"observed_at":"2026-08-07T15:42:46.289950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.997640Z","title":"Templatized fused vector floating-point dot product for high-level synthesis,","venue":null,"work_id":"28252965-ae82-4666-a8cd-6ff25faf93bf","year":2022},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.837986Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:8234163224b0db5a63b120261f31d723384a22d8c46f73945e8d710148b0c718","observation_id":"6be2cb52-9b72-4d12-a75e-6b2b464b6237","resolution":{"observed_at":"2026-08-07T15:42:46.107398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.760616Z","title":"SOLE: hardware- software co-design of softmax and layernorm for efficient transformer inference,","venue":null,"work_id":"aca5b48c-66b1-4412-9d0f-acdcfec4054e","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.892396Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:960c46f257889b508553dcc60f638912d043996f87586b230f8808ac658bcb96","observation_id":"846fc410-41d1-4944-af98-ba7a8780ab8c","resolution":{"observed_at":"2026-08-07T15:42:45.921795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.544649Z","title":"A pseudo-softmax function for hardware-based high speed image classification,","venue":null,"work_id":"4bd0f6ec-b050-4af8-8c93-7b121ccede53","year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.975312Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:79eba462dc273f36933c777e55a8f1bed7c497887399af3bb142f45122f3139f","observation_id":"a277cdac-02a1-4c13-bfc7-0670df9ea99c","resolution":{"observed_at":"2026-08-07T15:42:45.672152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.337580Z","title":null,"venue":null,"work_id":"82520531-42b2-4224-8f10-785931d4a0ff","year":2019},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.081992Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:9699fc85ea29aecb51b1d36522fa317abff035b80a15a107f295d882a5b5f40e","observation_id":"9864db61-9e6f-453b-ad20-dd321fa8a926","resolution":{"observed_at":"2026-08-07T15:42:45.444137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-04T04:17:53.148033Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-07T15:42:44.143506Z","title":"A study of bfloat16 for deep learning training,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.143506Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:0a700a002929237ef1d1956d829d560581b80c626932ebdfa9622df65997574d","observation_id":"ae3bb868-7e88-46ce-9cc4-dce72a816076","resolution":{"observed_at":"2026-08-07T15:42:44.143506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-07T15:42:44.231773Z","title":"Fp8 formats for deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.231773Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:8eb3686cdc859fd008a78f4ba8596888961c4b76212149b5ca45351ee286fb1a","observation_id":"9b71812c-8888-4890-9a49-da600fbe2d7c","resolution":{"observed_at":"2026-08-07T15:42:44.231773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:45.168806Z","title":"llama2.c,","venue":null,"work_id":"46f55dc8-6b61-4b04-a442-aad5ad6f77a7","year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.321271Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:ad026a5ee464b474d76a31a0a44f2b28405c4125a17c7c49495fdc7961413855","observation_id":"69bfcb20-f662-49e6-ba4c-34dd47ec368b","resolution":{"observed_at":"2026-08-07T15:42:45.225376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:44.991734Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"760da553-abf9-4333-9b23-e557cfbf7dcb","year":2020},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.407672Z"},"links":{"citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:4918c91a0af8d72a26c1d73affb281f4bd14daf51ffe459a2155366b9e9637e7","observation_id":"ac1a776d-c7f3-4bb4-ab42-eb83152947a4","resolution":{"observed_at":"2026-08-07T15:42:45.046848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07910","last_updated":"2024-08-20T00:28:45Z","snapshot_observed_at":"2026-08-05T04:16:54.399572Z","submitted_at":"2023-12-13T05:58:34Z","title":"PromptBench: A Unified Library for Evaluation of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07910","snapshot_observed_at":"2026-08-07T15:42:44.481313Z","title":"Promptbench: A unified library for evaluation of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:44.481313Z"},"links":{"cited_paper":"/paper/2312.07910","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:56bbfc4ad4c638926c0648a19f8557cbf66dbe78d620cb285f867afa0b02c7a9","observation_id":"e3b17ae8-85ee-4fe3-a048-05050b577aba","resolution":{"observed_at":"2026-08-07T15:42:44.481313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2505.14201."}