{"as_of":"2026-08-21T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d42f2d6716c98eda3b2bddd425812b4cc1fec7c70d7e32426c87b5b0b0e313ae","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:29:29.161352Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18824/citation-record","integrity":"/paper/2505.18824/integrity","json":"/paper/2505.18824/citation-record.json","paper":"/paper/2505.18824"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.180347Z","title":"On the computational complexity of self-attention,","venue":null,"work_id":"e4403f39-0781-4fee-83f6-c2d561f4fffd","year":2023},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.197619Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:b2c5858340fb6d7e23fefd4702a5d7507a9c4989d3af0f706ed823e36b665daf","observation_id":"6baf57a8-36f6-4226-92a5-69aa9eaf98e4","resolution":{"observed_at":"2026-08-07T14:29:34.233199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-19T23:21:25.570254Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-07T14:29:26.256211Z","title":"LLM inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.256211Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:f3c7c652f0c97fa5d4ac6c73a78a1a90b68f33f6f5e8d5b460b4fc29b9e87bf3","observation_id":"2da04287-b6d6-4094-9ce7-7ba8329aa926","resolution":{"observed_at":"2026-08-07T14:29:26.256211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:34.053642Z","title":"Data movement is all you need: A case study on optimizing transformers,","venue":null,"work_id":"a04cd0db-a66f-4544-896c-0c9bc8273d87","year":2021},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.366113Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:3bcd2a0b4bbed5c969debf5cb3435c5428a16de021553d8bf5dad4f35ecbb2e4","observation_id":"b0cfb9b3-f0e9-4eff-95a5-e7f8e75b694e","resolution":{"observed_at":"2026-08-07T14:29:34.117193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:33.921850Z","title":"FlashAttention: Fast and memory-efficient exact attention with IO-awareness,","venue":null,"work_id":"639fbba4-216c-47b7-b1be-5ed83cf50546","year":2022},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.504090Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:bf96ff638c3dc213bbcbf39d599b173b4231e05ac7537da337ca8aa8f783cf1a","observation_id":"b9234b8b-47e6-4fe6-9478-77b618a41694","resolution":{"observed_at":"2026-08-07T14:29:33.965439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:26.631529Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.631529Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:526db3b7e40a559f267d816499dede8a154cd89350d8f66bb950e618a887de8e","observation_id":"4b1303b3-74ce-4003-a6e8-97045b74dd87","resolution":{"observed_at":"2026-08-07T14:29:26.631529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-21T02:18:21.245681Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-07T14:29:26.731577Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.731577Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:abc23bdf8d55deae3719e2b4f5c7886a50f910019e44ddf2b4457f9065b3df4f","observation_id":"ff115aa5-8c1a-4601-a0ef-4a94f2508275","resolution":{"observed_at":"2026-08-07T14:29:26.731577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:33.752730Z","title":"SambaNova SN40L: Scaling the AI memory wall with dataflow and composition of experts,","venue":null,"work_id":"cd3721d2-c189-4b20-8e79-02ae1121254b","year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:26.876797Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:3375e564dbe07ba7a422b01348341c9ff63cc53ba7e2ddd868b63b80ac8bfbd6","observation_id":"ead9f0f6-6a3c-4d01-8439-511de6f2d9fe","resolution":{"observed_at":"2026-08-07T14:29:33.841153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:33.543576Z","title":"Wafer-scale AI: GPU impossible performance,","venue":null,"work_id":"519165ad-6831-4887-a048-57e7f0334fd1","year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.012739Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:1a80b98ebf6487653e620ed15bd963aa198ca277d06513872971d5b54ada0cba","observation_id":"555d3de4-b705-4e0b-9c89-cd24aeb2e39d","resolution":{"observed_at":"2026-08-07T14:29:33.637534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:33.374898Z","title":"Blackhole & TT-Metalium: The standalone AI computer and its programming model,","venue":null,"work_id":"ebbe467d-3e7d-4c23-b69c-9256b125d2a8","year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.140730Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:ae6a039e4bdcda7ce9ea963a571015ee967cdd8e92aa603f36b66fe87095ac2c","observation_id":"3ea76046-4229-47bc-9ca7-5f44509bda34","resolution":{"observed_at":"2026-08-07T14:29:33.468948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:33.241868Z","title":"16.2 rngd: A 5nm tensor-contraction processor for power-efficient inference on large language models,","venue":null,"work_id":"b1ae4593-cb3d-40b5-9b0e-9039251758a4","year":2025},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.260624Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:785a76f4c1cb9f9356abe98709fed20c4c20c2f5a7f9e1ab55613d0556c76cfe","observation_id":"f5bedae7-44b5-429c-85de-efbe08a69ee3","resolution":{"observed_at":"2026-08-07T14:29:33.303301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13885","last_updated":"2024-07-18T20:19:36Z","snapshot_observed_at":"2026-08-16T13:32:54.747354Z","submitted_at":"2024-07-18T20:19:36Z","title":"Attention in SRAM on Tenstorrent Grayskull","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13885","snapshot_observed_at":"2026-08-07T14:29:27.394330Z","title":"Attention in SRAM on tenstorrent grayskull,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.394330Z"},"links":{"cited_paper":"/paper/2407.13885","citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:0a9797eeb0557ac486ddb88afc4d66642ef2d9210c5b5260f6a54b74a53eb84a","observation_id":"47282922-b877-4fad-93a0-853e5b5f66bb","resolution":{"observed_at":"2026-08-07T14:29:27.394330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:33.102986Z","title":"FLAT: An optimized dataflow for mitigating attention bottlenecks,","venue":null,"work_id":"37473f03-7623-4b02-aad2-81020a9015e6","year":2023},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.554302Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:45066924ab8893703409cfa8f9376b7cdb62d1df45db40938d2c0bf93a2925b2","observation_id":"a08011de-6c7d-4a4d-834e-bc71041f9341","resolution":{"observed_at":"2026-08-07T14:29:33.164993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:32.953233Z","title":"Fusemax: Leveraging extended einsums to optimize attention accelerator design,","venue":null,"work_id":"3c1e96c2-80a7-4292-90b4-dd598426cda2","year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.667462Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:48026296b8b4748341e7d98b1f31715c2c127936bbba4e0ec857f6ae3c4b29f6","observation_id":"2bff695c-0266-4cd1-ad94-120f6114f8ee","resolution":{"observed_at":"2026-08-07T14:29:33.034879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:32.758732Z","title":"Gemini: Mapping and architecture co-exploration for large- scale DNN chiplet accelerators,","venue":null,"work_id":"55ba0986-77a8-44d4-9573-e4b895dd0c90","year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.784853Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:f81b4a9ac54eb15d715a5726493844bc6c6f5665004283089a20f4d30f41022b","observation_id":"bb749651-27e1-4ec3-ba8e-74bbc933b1ae","resolution":{"observed_at":"2026-08-07T14:29:32.881056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:32.516450Z","title":"DOJO: The microarchitecture of Tesla’s exa-scale computer,","venue":null,"work_id":"78dfa906-9513-4870-8c7c-71a135ef9c26","year":2022},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:27.883144Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:0f7f85b8ae1bc3925fc590d823d2c6b23fd1bf25125b4d1a88c7d50f1e3e7d4a","observation_id":"b3bf5695-480a-476c-99a9-b3a58ff851e5","resolution":{"observed_at":"2026-08-07T14:29:32.650726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:32.253263Z","title":"Collective communication,","venue":null,"work_id":"51cbc907-c821-41d2-ad4d-7bd78659f985","year":2011},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.022282Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:d7636d0ee05d560eec47acc2d868a62afee9f3634727ef126e0073625762f5ec","observation_id":"05faa99a-a993-4ae1-af69-9b1534aa2b64","resolution":{"observed_at":"2026-08-07T14:29:32.384160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.928778Z","title":"Towards the ideal on-chip fabric for 1-to-many and many-to-1 communication,","venue":null,"work_id":"eb1214b0-9434-488b-94e4-5590098f3fac","year":2011},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.127464Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:885667609ab6663e2655e9f7b1e9a90e2e6d0111c58301e98622bc005f390248","observation_id":"0a933052-8573-4252-86f6-55e8dd9aedf4","resolution":{"observed_at":"2026-08-07T14:29:32.102965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.575370Z","title":"GVSoC: a highly configurable, fast and accurate full- platform simulator for RISC-V based IoT processors,","venue":null,"work_id":"3dbb5e93-b20a-407b-9076-6c44e11daae7","year":2021},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.250138Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:38f17fc141f8bee0a8ca7c284516dbbb3af6c497e0eebcecde6e6232d29cb4a0","observation_id":"decf9542-b5a8-411a-8e29-25f720ce5dcc","resolution":{"observed_at":"2026-08-07T14:29:31.742199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.318764Z","title":"Snitch: A tiny pseudo dual-issue processor for area and energy efficient execution of floating-point intensive workloads,","venue":null,"work_id":"bff254a3-85aa-43d7-b18e-ed8500e2be3d","year":2020},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.357031Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:ce775373bc66e0728c75ac2060e18eb1c06388dc95a3f0a71c0c7c7d15b27286","observation_id":"8d73a607-c1f1-4753-be67-0d6e73a8d4f1","resolution":{"observed_at":"2026-08-07T14:29:31.429126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:31.054182Z","title":"Spatz: Clustering compact RISC-V-based vector units to maximize computing efficiency,","venue":null,"work_id":"eba66d5d-ae97-4533-a1c9-9bd7516044c3","year":2025},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.485665Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:eb29e18351b54217412a2d5f88f16d1219a7f0d5570b5d2dfa5f14ab92c953c7","observation_id":"7c482cb8-b5c9-422f-a249-418a79543af7","resolution":{"observed_at":"2026-08-07T14:29:31.190544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.719302Z","title":"A high-performance, energy-efficient modular DMA engine architecture,","venue":null,"work_id":"86a62d80-0832-4607-9dcd-4f2a36f57415","year":2023},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.604764Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:5243cbec1cdc88b75a5c7fdc9597c79e730343190f596dd19398412e458b828d","observation_id":"c91be4fd-2578-4fca-9f12-9b05c8bff576","resolution":{"observed_at":"2026-08-07T14:29:30.874902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.397996Z","title":"RedMule: A mixed-precision matrix–matrix oper- ation engine for flexible and energy-efficient on-chip linear algebra and TinyML training acceleration,","venue":null,"work_id":"b4c87bc1-3e91-40fc-9791-e51c59f66abf","year":2023},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.720003Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:4f9168c40bbccc4f9f44b27ef4fd973155bebe0ee192451c5ee95430a085819b","observation_id":"1c013230-326d-4b0a-b056-7555a1d7a0ba","resolution":{"observed_at":"2026-08-07T14:29:30.533129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:30.104393Z","title":"FlooNoC: A 645-Gb/s/link 0.15-pJ/B/hop open-source NoC with wide physical links and end-to-end AXI4 parallel multistream support,","venue":null,"work_id":"2c1f2453-a5c3-4ff5-82a9-c6e2e092cf0c","year":2025},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.830392Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:b4bc01fbcce76b6098ea48b35cdd4f99a12b97b1e94aab3a19a17a7716bd2673","observation_id":"c09561ed-bd44-40a2-9f50-dbc1fa446dcd","resolution":{"observed_at":"2026-08-07T14:29:30.278817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:29.779976Z","title":"DRAMSys: a flexible DRAM subsystem design space exploration framework,","venue":null,"work_id":"15cced32-0dc1-41fd-91b5-4795fde6bb7d","year":2015},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:28.952136Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:1993a9a8e01a44547c1673c966865c251b699a8abe50d8bf03aa3b8e4f6a1508","observation_id":"f01a241a-6578-4f5a-a103-07e2a786ee47","resolution":{"observed_at":"2026-08-07T14:29:29.966934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:29.547550Z","title":"SUMMA: Scalable universal matrix multiplication algorithm,","venue":null,"work_id":"24c285cf-13ec-4cd6-bbc4-c74390fed3fe","year":1997},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:29.047456Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:64f3b09a842f174abb9ff27d5316139ee027863cde940aa3e4ba4c1c4db80ae4","observation_id":"d0180082-2dda-450a-a015-df5fd2fa1707","resolution":{"observed_at":"2026-08-07T14:29:29.651742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:29:29.330532Z","title":"MI300X vs H100 vs H200 Benchmark Part 1: Training,","venue":null,"work_id":"b31707fe-8e6f-46a8-a118-90de7e847383","year":2024},"citing_paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:29.161352Z"},"links":{"citing_paper":"/paper/2505.18824"},"observation_digest":"sha256:4275aceca697b5e3a4239d720aeb575db3cc60f9e654d99d4b9d37645dfb9395","observation_id":"6d21fc12-e934-4bfc-924e-d552d33a1e7e","resolution":{"observed_at":"2026-08-07T14:29:29.425767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18824","last_updated":"2025-05-24T18:50:04Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-17T20:16:15.953991Z","submitted_at":"2025-05-24T18:50:04Z","title":"FlatAttention: Dataflow and Fabric Collectives Co-Optimization for Efficient Multi-Head Attention on Tile-Based Many-PE Accelerators"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2505.18824."}