{"as_of":"2026-08-20T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97e9716ba0549d8e7beaca69d8cb930a85ed4633951f60f7a5f34c6003865f72","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T03:24:08.548348Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09385/citation-record","integrity":"/paper/2607.09385/integrity","json":"/paper/2607.09385/citation-record.json","paper":"/paper/2607.09385"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"AIOS: LLM Agent Operating System,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:72e91e30ea10f510c1d50990bddb5c854222229d84dbb3bdc9c5662d311679c3","observation_id":"8f797521-39f6-4039-a6c6-7b6c7474d6f3","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07885","last_updated":"2026-08-07T02:40:27Z","snapshot_observed_at":"2026-08-15T13:29:16.605397Z","submitted_at":"2025-11-11T06:33:30Z","title":"Intelligence per Watt: Measuring Intelligence Efficiency of Local AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07885","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Intelligence per Watt: Measuring Intelligence Efficiency of Local AI,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2511.07885","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:3847b7a3f25ff79e22589db17089c9ba2628cdca8b5395ff669716e986584f5b","observation_id":"6cabc7fb-7d3e-4737-bb29-1bfe8855bd16","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"A survey on privacy risks and protection in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:37a41c6cfb460baa33c3801c4abb89524e624a1f39eea4db22b809eaba33872b","observation_id":"c86430ee-29e0-452a-bc8e-e86670bc3a88","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"AMD XDNA NPU in Ryzen AI Processors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:025596295eba193a0a86fb79002dbd662d5693372b84de0651e0cf9213b26183","observation_id":"0169cce9-deab-44a9-8f4c-7623e2f15737","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16663","last_updated":"2024-10-22T03:29:33Z","snapshot_observed_at":"2026-08-16T13:07:08.865162Z","submitted_at":"2024-10-22T03:29:33Z","title":"FastAttention: Extend FlashAttention2 to NPUs and Low-resource GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16663","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"FastAttention: Extend FlashAttention2 to NPUs and Low-resource GPUs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2410.16663","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:db213e4e1bc919f43648c2ac48f20cadf4e0c265f06b99feda6a44ec1d8e9843","observation_id":"791d64a9-ac84-444e-b942-900736d56b01","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11053","last_updated":"2024-12-15T05:15:54Z","snapshot_observed_at":"2026-08-16T20:17:58.136308Z","submitted_at":"2024-12-15T05:15:54Z","title":"NITRO: LLM Inference on Intel Laptop NPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11053","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"NITRO: LLM Inference on Intel Laptop NPUs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2412.11053","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:52fed9874be71d119a993f2558040e8c4129f01d5f661365a67abecb70847704","observation_id":"51625f01-9fe2-453c-8512-c5041da42fcb","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"LServe: Efficient Long-sequence LLM Serving with Unified Sparse Attention,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:2a407e9ec2f38b05b4045fa666016659249b861e785d7c2f498c60177ed5ecb2","observation_id":"af5092ae-d8e8-4f46-86e4-7fe8a3f2fb01","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:eba68b37a04ac3969e45e0547aa22ab27dcd08b103397e2079ed4bea62635cf2","observation_id":"2e0449c7-df1e-4cf9-bb57-244104506728","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"ITA: An Energy-Efficient Attention and Softmax Accelerator for Quantized Transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:54c00617f51d9c3d2e6dd6a3b2bbcfe324b3045a7d8d44a8cc8270eaa43ec912","observation_id":"ec5e0bda-8a02-41f0-904c-6d37dd09f835","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"PACE: An Optimal Piecewise Polynomial Approximation Unit for Flexible and Efficient Transformer Non- linearity Acceleration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:9b703d43f7a63e6a164eb60760131a90e7ad50d692118e1ca37584dc0f62ba76","observation_id":"49393d3c-451d-4193-8683-07a989579fdb","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Efficiency, Expressivity, and Extensibility in a Close- to-Metal NPU Programming Interface,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:c3551ac288257585cecc50f29095cdeeb3a13a54435a2fb40759045263e1211d","observation_id":"298e2b47-4141-406d-9e07-8406b95e6788","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:60771eee60d239122be76847741a22a26a673a2e9cd1d582c9c87d733ee3f619","observation_id":"c5179c24-4ad6-4893-8a0c-ee762a67cb6d","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06794","last_updated":"2025-09-08T15:22:51Z","snapshot_observed_at":"2026-08-18T14:20:46.227536Z","submitted_at":"2025-09-08T15:22:51Z","title":"Dato: A Task-Based Programming Model for Dataflow Accelerators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06794","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Dato: A Task-Based Programming Model for Dataflow Accelerators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2509.06794","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:fb1639dcf81f5f66846bb8498a3d6fad1b8470daa672acc373786604a99bfc6d","observation_id":"04dc20c6-24a3-41c4-a0f9-208596bc28e4","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"The Llama 3 Herd of Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:6f5c628159662fd9df575a8ee11799218b777d22e2d82d55ecf95a683a17f745","observation_id":"e84660a6-0c51-43d8-9400-dd4e96c4dbab","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Attention is All you Need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:3d06c2c60516106fd87143203b1b9f8a5d741b7680937df6705a3a2a627cb8e9","observation_id":"81227a4a-1e43-4901-bdfe-527f98b79a34","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-08-18T07:55:39.603370Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Online normalizer calculation for softmax,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:6d3081920e706c4ae720150efab499757107025b4b8e0c53341c1898b34bd3cb","observation_id":"e7938933-4197-4fa2-9022-0f06f642c0fb","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Qualcomm Hexagon DSP: An architecture optimized for mobile multimedia and communications,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:774eeb1ef5aade25c2ee74d004be551271866632cfbdf3da6f6fb8db575a354f","observation_id":"7cf0515c-fe3e-4696-b449-af178db110ce","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"ASCEND-CC: Confidential Computing on Heterogeneous NPU for Emerging Generative AI Workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:8c2cd5833be5da646e2f097211441ae68efa0eb6f2569e24820bbc2c5b9c22db","observation_id":"bf284211-aa75-478b-ba22-d8d79a5c40a4","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"SPARTA: Spatial Acceleration for Efficient and Scalable Horizontal Diffusion Weather Stencil Computation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:a75ee0165558f964c58bccec6014dcf460b160e30f4bb035a967961df08688ec","observation_id":"89afd327-e73c-4ae8-a86b-eec2d7666a7d","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"You Only Look Once: Unified, Real-Time Object Detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:99c05edd384a4942e7e56160502b7a35b1fc95e99020c4841d4611e492331fc7","observation_id":"e9be7f1d-72f1-4fb9-8a13-f64e5799deea","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"14.5 Envision: A 0.26-to-10TOPS/W subword- parallel dynamic-voltage-accuracy-frequency-scalable Convolutional Neural Network processor in 28nm FDSOI,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:e5073a62afc6f164dde781305c94b206bb63524bfe730655c7c80cfa93dafbae","observation_id":"939f641c-a518-4d11-a121-0072a340699f","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"Basic Linear Algebra Subprograms for Fortran Usage,","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:0660d7c47dab3042b4f5dd556f3295e956ad7fc3d271c74f736addbbe938bb28","observation_id":"c3e47a6b-c8dd-4345-ac33-9ceea2c88789","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"AKG: automatic kernel generation for neural processing units using polyhedral transformations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:eb2c9911d33aa370d0799827bead1d7da8774f1bf2160481d48a0d7df21699a2","observation_id":"231500f8-a40c-4e67-a058-00385c9cff44","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T03:24:08.548348Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T03:24:08.548348Z"},"links":{"citing_paper":"/paper/2607.09385"},"observation_digest":"sha256:6f87eb47f2912036c40bd91ba1f6d39d6089616c502bf4ebbb7661ae258a4f9e","observation_id":"99b59607-afdf-41b0-a2ad-0073f3ef1f0b","resolution":{"observed_at":"2026-07-13T03:24:08.548348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09385","last_updated":"2026-07-10T13:09:47Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-14T06:40:12.727154Z","submitted_at":"2026-07-10T13:09:47Z","title":"STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.09385."}