{"as_of":"2026-08-16T04:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97bce44b17a3342ee9e420bd877cda8610515eebc47e2d6c6037954c5fdf59be","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:20:03.210254Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17720/citation-record","integrity":"/paper/2411.17720/integrity","json":"/paper/2411.17720/citation-record.json","paper":"/paper/2411.17720"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.463982Z","title":"https://docs.nvidia.com/deeplearning/tensorrt/archives/tensorrt-803/best-practices/index.html","venue":null,"work_id":"4d13ba3b-cddf-4a67-9ff9-1e13b95bd8b7","year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.783745Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:b5bb467ce2f3efabfaa3595a640687006799f13e4cfae6a4455dd20b121f75f3","observation_id":"08ddaea7-4bee-4635-8789-45e8964ad17f","resolution":{"observed_at":"2026-08-12T16:20:15.471320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.442283Z","title":"https://developer.apple.com/documentation/accelerate/bnns, a","venue":null,"work_id":"ba278209-c813-4827-a105-2db6efc83f06","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.789786Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:1a1570686cdc8b5503c93403b23fb9e9d3234d4ed212c0dad1f0ce447d9512f7","observation_id":"a4970715-898a-4066-a788-ea774ac0a9a8","resolution":{"observed_at":"2026-08-12T16:20:15.448648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.421968Z","title":"https://apple.github.io/coremltools/docs-guides/source/opt-palettization-overview.html, b","venue":null,"work_id":"5d11a1b3-ac20-478d-b3cf-c1f35bdf97a8","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.795001Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:e4999c8d15fc83a0d867eb4abb7146d6f3ec78932331668360804d7b60341435","observation_id":"3243a98a-67db-467f-a5ee-58fedbce9656","resolution":{"observed_at":"2026-08-12T16:20:15.427703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.404385Z","title":"https://developer.apple.com/documentation/metalperformanceshadersgraph, c","venue":null,"work_id":"f5f70d87-1606-4571-8b65-42d71bb2697a","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.800450Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:adff3abc72c02cd973fe9295f8b39b478124755e37532861f763acd348f8d170","observation_id":"bdab1616-2a0f-4fa2-82e6-baf3a1b60459","resolution":{"observed_at":"2026-08-12T16:20:15.409736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.386338Z","title":null,"venue":null,"work_id":"7cfb6089-3e64-4a75-b184-e867fc47fff0","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.805879Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:49ba25f17a6efc671e38a75f6dc142c6ee44e1afb6620b0d3f92f86b13376cc3","observation_id":"15003672-7012-4a93-acc2-1847b4cba90a","resolution":{"observed_at":"2026-08-12T16:20:15.391770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.367775Z","title":"https://www.tensorflow","venue":null,"work_id":"a39fe42a-a73b-4eee-a684-d68a89584406","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.811069Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:9cc15d482bd63b64afcd8b44a60b746528420138264ab441d2dfc6a23a9f98c8","observation_id":"d5088739-c155-403a-b9ec-bc3906eb6fd3","resolution":{"observed_at":"2026-08-12T16:20:15.373257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:02.817329Z","title":"Y., Rajbhandari, S., Awan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.817329Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:d56f85494c9fe0a1614d1eb71541d92e070f545eaed70131f25d249ac66f0e01","observation_id":"cb93ec47-6c47-45ec-ba94-95a0c8ff885d","resolution":{"observed_at":"2026-08-12T16:20:02.817329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.327364Z","title":"B., Del Sozzo, E., Akkas, A., Zhang, Y., Suriana, P., Kamil, S., and Amarasinghe, S","venue":null,"work_id":"f73bcc36-d024-486d-99b5-0814c57fa6df","year":2019},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.822792Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:e2b34839ea1e3a22221d9c0486dc2acb688ece540afc8060837593857bf966a8","observation_id":"57db820d-51e3-4f8d-8de9-c98fe27b3422","resolution":{"observed_at":"2026-08-12T16:20:15.336420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.300799Z","title":"\\ TVM \\ : An automated \\ End-to-End \\ optimizing compiler for deep learning","venue":null,"work_id":"2427e058-c32a-4fa1-8a1a-8bb121aff2d6","year":2018},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.830076Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:46bef22721db0d65c8e4dd6b909980169275c8f9986a52b88847dd5ac24ee331","observation_id":"dc2bee9f-c6ff-4cb5-9eed-eed8944db39f","resolution":{"observed_at":"2026-08-12T16:20:15.309182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.275028Z","title":"Learning to optimize tensor programs","venue":null,"work_id":"de13f1a1-8e5b-443d-a529-9664e9b9652a","year":2018},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.836041Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:0572efd6a0386c30edfeeb885ee091e3a5d6394ec6f0566a56fa270519a20219","observation_id":"43f3e696-0448-442b-8e1a-b2c1b6a68453","resolution":{"observed_at":"2026-08-12T16:20:15.280430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.253368Z","title":"Eyeriss v2: A flexible accelerator for emerging deep neural networks on mobile devices","venue":null,"work_id":"d716f191-f0dc-48ee-8b96-1428c6c6bd94","year":2019},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.842077Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:ca96795554f8d761473945697ed2444cd9e5d1841db20fea0cafe5bacd899d31","observation_id":"55476913-9260-4e8d-8641-16e3905322c1","resolution":{"observed_at":"2026-08-12T16:20:15.259117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12659","last_updated":"2022-02-20T16:47:22Z","snapshot_observed_at":"2026-08-13T18:21:06.217983Z","submitted_at":"2021-08-28T14:35:41Z","title":"DKM: Differentiable K-Means Clustering Layer for Neural Network Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12659","snapshot_observed_at":"2026-08-12T16:20:02.848229Z","title":"A., Adya, S., and Rastegari, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.848229Z"},"links":{"cited_paper":"/paper/2108.12659","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:849e30deb7aeb4fa5fa578b2c1838614be6489cbcfb1383a5c5f28f9bc88500a","observation_id":"211ed60a-b480-419d-942b-dcae66d7d2f5","resolution":{"observed_at":"2026-08-12T16:20:02.848229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05329","last_updated":"2024-05-13T18:32:37Z","snapshot_observed_at":"2026-08-13T00:12:06.467235Z","submitted_at":"2024-05-08T18:03:22Z","title":"KV-Runahead: Scalable Causal LLM Inference by Parallel Key-Value Cache Generation","version":2},"cited_work":{"arxiv_id":"2405.05329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05329","snapshot_observed_at":"2026-08-12T16:20:14.359703Z","title":"KV-Runahead: Scalable Causal LLM Inference by Parallel Key-Value Cache Generation","venue":"cs.DC","work_id":"d3eeec13-3736-4fa0-800a-1a1ce1411636","year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.854975Z"},"links":{"cited_paper":"/paper/2405.05329","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:9498287a0606a6ef113a99b112d1d67da391cb120bf7ff50a220bd062e56653f","observation_id":"b1cd0939-2d2c-4056-9593-6f0adb04c06c","resolution":{"observed_at":"2026-08-12T16:20:14.369076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-12T16:20:02.862330Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.862330Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:7f6ac5d12eb81d896741e3b129bedca606b5e76843751f6b5efd08649aeabf8f","observation_id":"f7170fa5-29ef-4020-b071-a53080d6c696","resolution":{"observed_at":"2026-08-12T16:20:02.862330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:02.867992Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.867992Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:6cf3e1fda9f26269719a755868ec36aebe98b4cdede6a18097f23b1acb4dca22","observation_id":"657bbd5a-c650-4f11-a93a-19b054cab6f9","resolution":{"observed_at":"2026-08-12T16:20:02.867992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T16:20:02.873180Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.873180Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:942de48e2586699650805083f96f0f56bb9234ea60564cb09b02384bed098116","observation_id":"d7eac942-454e-4b2b-ab0f-2ea4d77b8de9","resolution":{"observed_at":"2026-08-12T16:20:02.873180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T16:20:02.878218Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.878218Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:7170f282d019526faf4c2fea84fbf43c2ec6560b0b90942d2dc6f7d38b948dcf","observation_id":"c218a399-5fdd-41d8-ba87-b2981d6d77f0","resolution":{"observed_at":"2026-08-12T16:20:02.878218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:02.883210Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.883210Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:d96581b97fead2fbb7da0270557ad6274543500c11cd0fde92ef476732333e00","observation_id":"1085b971-9779-4f53-872a-6ea70244359e","resolution":{"observed_at":"2026-08-12T16:20:02.883210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.200702Z","title":"Videoagent: A memory-augmented multimodal agent for video understanding","venue":null,"work_id":"735d83b6-ec20-4555-a816-2ad2242aed7c","year":2025},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.889268Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:60ad203620ce91450133dcdbf3e8604d6dbfc523bd6a3fdf9c09df888501c59c","observation_id":"4cb0e3f2-cc72-49a5-8545-a3c623e882ff","resolution":{"observed_at":"2026-08-12T16:20:15.209274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.173869Z","title":"A., Yang, Y., Sajjad, H., Nakov, P., Chen, D., and Winslett, M","venue":null,"work_id":"0b41358a-6b6b-46ca-9464-7575476b9012","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.895539Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:c5c82ae8b2ec3bec3aa357cf350c0cdda58d487ca2e39278f50cec0212e9da6f","observation_id":"422ae86d-9f4f-4d19-86d5-a3a043454b43","resolution":{"observed_at":"2026-08-12T16:20:15.181293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.147503Z","title":"Collective loop fusion for array contraction","venue":null,"work_id":"155d6b2e-a86e-4225-9181-d838beba036b","year":1992},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.900740Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:2175ca4185839a774807375d4cf683e602e4236e2b6f4f5e35c34803f62a9939","observation_id":"f1c2b330-65ae-48bb-9f1f-8e8f0f4838ab","resolution":{"observed_at":"2026-08-12T16:20:15.155247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-11T23:28:54.309888Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-12T16:20:02.906203Z","title":"Improving alignment of dialogue agents via targeted human judgements","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.906203Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:fe35191708989edee26034f33d1cc9d74790d0ec194d5d64f0aba23cf4e67bc8","observation_id":"74701642-78c7-4236-8b3d-53d277a454e8","resolution":{"observed_at":"2026-08-12T16:20:02.906203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02677","last_updated":"2024-01-05T07:21:46Z","snapshot_observed_at":"2026-08-13T04:48:36.733346Z","submitted_at":"2024-01-05T07:21:46Z","title":"Progressive Knowledge Distillation Of Stable Diffusion XL Using Layer Level Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02677","snapshot_observed_at":"2026-08-12T16:20:02.911109Z","title":"V., Prabhala, H., Paul, S., and Von Platen, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.911109Z"},"links":{"cited_paper":"/paper/2401.02677","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:e6fe3126951e6b5744d04098cdb22e8f9679911ca7126afbfe3065746021466c","observation_id":"2e33714f-b51c-4fb2-993d-70bc49c617ef","resolution":{"observed_at":"2026-08-12T16:20:02.911109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-14T10:57:33.114072Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-12T16:20:02.915968Z","title":"Flashdecoding++: Faster large language model inference on gpus","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.915968Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:26db05df4336028fa0592d07b0a1061e222318526365370eae74bccbc11ea7cf","observation_id":"615c5762-3583-416c-8876-20a484ea1b5b","resolution":{"observed_at":"2026-08-12T16:20:02.915968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.123732Z","title":"Knowledge diffusion for distillation","venue":null,"work_id":"26a726b9-1c9c-4300-b787-48b7d7ea8380","year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.920773Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:aba3fac9a2e5cea1b2fd684c4f6b769b6516aada56e8c72d743a8edcbec3c236","observation_id":"25e62ec3-a073-4629-a8fc-b6b2faebed7c","resolution":{"observed_at":"2026-08-12T16:20:15.129432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.104432Z","title":"Data movement is all you need: A case study on optimizing transformers","venue":null,"work_id":"1a4e80f2-fb1c-4c3a-9f94-5797cd82234e","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.925474Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:5a4f05750b681f116a8034172cb7b251b0bd826f7405543e85a0d6cc53f8933c","observation_id":"e59812d8-4cad-4ae5-b3e9-b6405a920dc5","resolution":{"observed_at":"2026-08-12T16:20:15.110169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.082285Z","title":"P., Young, C., Patil, N., Patterson, D., Agrawal, G., Bajwa, R., Bates, S., Bhatia, S., Boden, N., Borchers, A., et al","venue":null,"work_id":"3801f54b-d772-47dc-845c-ead30b7bf8c0","year":2017},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.932705Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:cd12c8cd61169590fdd0b91cdc89506aedf533f0d35ff2600314cc4461fa257c","observation_id":"6a5d504d-efc5-4178-800a-4a1300b2c002","resolution":{"observed_at":"2026-08-12T16:20:15.089089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:02.937725Z","title":"P., Yoon, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.937725Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:cb352ed40804ee8803a2ba2068bac832bb28e82beb7501e430a88b61dd04e6ed","observation_id":"3ad6a27f-c2a2-4f61-b25c-f5ba091fd81c","resolution":{"observed_at":"2026-08-12T16:20:02.937725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.041749Z","title":"Flat: An optimized dataflow for mitigating attention bottlenecks","venue":null,"work_id":"ccc68ef6-d983-47c6-9e44-c749ba68f2e5","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.942641Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:f6664831df6c0d4173f0329edc745714ee936f48fc4d9349e48c383b22af4b08","observation_id":"aa871e7b-7345-4c69-93df-ad5768587f41","resolution":{"observed_at":"2026-08-12T16:20:15.049068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T16:20:02.947873Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.947873Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:252c2e55a4358be2b0ccb51948f34a0edc69d048f32f781effa8004c3fcba9ab","observation_id":"070363a4-5661-4352-a63a-91533cb51988","resolution":{"observed_at":"2026-08-12T16:20:02.947873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:15.022390Z","title":null,"venue":null,"work_id":"d4b790b7-fdd6-492d-bef8-8e74fa92649e","year":2007},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.956659Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:7e11c60386ea303032a0a839e834dbf0095512ae410d424fe96489edf6433272","observation_id":"97e04be2-41ff-4b7a-a040-a4e2640bdcc7","resolution":{"observed_at":"2026-08-12T16:20:15.028721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-12T16:20:02.962077Z","title":"Reformer: The efficient transformer","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.962077Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:2c9db69c441f923ae93e24be866e6e378dc83cca5377581f62c988586c1b9acb","observation_id":"569d0a15-f1a2-4c9f-ba9c-3b0b9a387fee","resolution":{"observed_at":"2026-08-12T16:20:02.962077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.995523Z","title":"The tensor algebra compiler","venue":null,"work_id":"fb02a4e5-ea67-4d64-b647-82a070a8d22f","year":2017},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.967349Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:d84476d854f8cb75b1e22f0cb7e15e8122ae7579882f84a65c6e072c85f3cd0f","observation_id":"13f8cc53-bd8d-4be6-9fcb-8354ca092ca8","resolution":{"observed_at":"2026-08-12T16:20:15.000367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.977759Z","title":"Maeri: Enabling flexible dataflow mapping over dnn accelerators via reconfigurable interconnects","venue":null,"work_id":"74a8aa69-4ce2-4ea9-a665-8a7be831fd99","year":2018},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.972663Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:593caf6e7d80e9f8b3cfba36efb20be2d07f5fc408fed787888c621b3547c4b8","observation_id":"aaa3a126-5fc9-44ae-92f2-b558261aea1e","resolution":{"observed_at":"2026-08-12T16:20:14.983792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:02.978310Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.978310Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:898ec4ca3265774b25618bac99b96668ddc06d84b1d67fbd068d9b9a0d921b85","observation_id":"bd67bee7-737f-4788-8072-a4de1a0eb552","resolution":{"observed_at":"2026-08-12T16:20:02.978310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07291","last_updated":"2019-01-22T13:22:34Z","snapshot_observed_at":"2026-08-14T17:27:41.965844Z","submitted_at":"2019-01-22T13:22:34Z","title":"Cross-lingual Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07291","snapshot_observed_at":"2026-08-12T16:20:02.983558Z","title":"and Conneau, A","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.983558Z"},"links":{"cited_paper":"/paper/1901.07291","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:39680fa2509d41c4b7ebef7f076343b87d50cba29907b6b9a6c7dc420abbadbd","observation_id":"39fc4848-91d3-4769-b67d-ebc210374f78","resolution":{"observed_at":"2026-08-12T16:20:02.983558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.946737Z","title":"Multimodal foundation models: From specialists to general-purpose assistants","venue":null,"work_id":"ab6a0321-0a4c-4aca-8843-cf4539b2e4a1","year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.988978Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:cf3e81204e9703128b780e952cbfec9a09085f22eddd6dd4d8b2a42909bf78b5","observation_id":"4a51a011-c030-4bb1-aa98-75b0c8640d66","resolution":{"observed_at":"2026-08-12T16:20:14.952238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.929250Z","title":"onednn graph compiler: A hybrid approach for high-performance deep learning compilation","venue":null,"work_id":"957ac9a9-fce5-45ff-9532-a283055ee7f6","year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:02.994280Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:70115836bc57b8b51d59fa7282c9a4a747d2f1896dc5ee8b1b4a07f482511570","observation_id":"8ca1f9a9-53a8-476b-97d4-9d718451e61b","resolution":{"observed_at":"2026-08-12T16:20:14.934454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.909455Z","title":"Q-vit: Accurate and fully quantized low-bit vision transformer","venue":null,"work_id":"6def3080-c2d9-4970-a857-8947072d497d","year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.000080Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:dff4b53cd1375c16c0d1e1ed2276268d0fc0be8df92d9fe24158a0654c9b16ca","observation_id":"6f007858-1bc0-4d1f-85be-eda741ddb22f","resolution":{"observed_at":"2026-08-12T16:20:14.916406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.890998Z","title":"and Gu, Q","venue":null,"work_id":"5edf7b15-ddff-46eb-a5f9-e4caaae4d34b","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.005303Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:ddea199bc6cf201c03ebfc66b717e7455351341a4b6bfcf42ce3159ca26083f7","observation_id":"8b3bfa95-725f-4604-af59-7f418b843ada","resolution":{"observed_at":"2026-08-12T16:20:14.896384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.869340Z","title":"Davinci: A scalable architecture for neural network computing","venue":null,"work_id":"41c7e8ec-bf57-413f-b1a3-d6a342fa1be7","year":2019},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.010957Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:c85cc7b0be53b60964e4b5f81fc3b2d94bc328ce5e71ef8b60c054dacfedc878","observation_id":"387af77b-2df8-4b2d-accf-3a4946d51a77","resolution":{"observed_at":"2026-08-12T16:20:14.876522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13824","last_updated":"2023-02-17T13:17:52Z","snapshot_observed_at":"2026-08-13T17:27:03.163911Z","submitted_at":"2021-11-27T06:20:53Z","title":"FQ-ViT: Post-Training Quantization for Fully Quantized Vision Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13824","snapshot_observed_at":"2026-08-12T16:20:03.015840Z","title":"Fq-vit: Post-training quantization for fully quantized vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.015840Z"},"links":{"cited_paper":"/paper/2111.13824","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:287d70ecb9ae5238fbae0aabffaa810c87276424030a886df2adca51c7229cf5","observation_id":"625db241-1661-40fc-a0c5-98b2bd369dfa","resolution":{"observed_at":"2026-08-12T16:20:03.015840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-12T16:20:03.021686Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.021686Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:1a20f15aa30fc6bd6b75767d49a4565b9534157bf48e75a65687361d5225e56e","observation_id":"aa7dbaca-1be1-4882-aeae-022dee9fcd61","resolution":{"observed_at":"2026-08-12T16:20:03.021686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.852676Z","title":"Post-training quantization for vision transformer","venue":null,"work_id":"e99ad747-ed9f-4ca4-bdf3-1f2038ff9c33","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.027499Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:cc861dcca68fc4a4ecdbb80a93dc40f6ce7cb001a2615b49e9022d33f24d341e","observation_id":"88ad4273-175f-4742-a4ff-5fee35e01732","resolution":{"observed_at":"2026-08-12T16:20:14.858186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.832520Z","title":"Tprune: Efficient transformer pruning for mobile devices","venue":null,"work_id":"70f56284-3fc7-4746-870b-c5500e1e5c3e","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.032104Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:c046dbd72ff4ab347c45a09a53c38f20fa24aa43c6eeff0b58117f025a98d649","observation_id":"0ed8ecc8-2895-4b75-8eb6-691ee52ec6bd","resolution":{"observed_at":"2026-08-12T16:20:14.838320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-08-13T00:24:15.939292Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-12T16:20:03.037584Z","title":"H., Cao, Q., Horton, M., Jin, Y., Sun, C., Mirzadeh, I., Najibi, M., Belenko, D., Zatloukal, P., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.037584Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:afe4b46f4f838d51e1818c3040ad46200bb00d6366f579adce610494e3e5ef98","observation_id":"f8ee8da5-b38d-4077-8b0b-383e1b4b42de","resolution":{"observed_at":"2026-08-12T16:20:03.037584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.811710Z","title":"Defines: Enabling fast exploration of the depth-first scheduling space for dnn accelerators through analytical modeling","venue":null,"work_id":"63152974-45b2-4dca-8351-c3d13516885c","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.042845Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:f88c1e722f64a9e4a982e6e8218d38ed7234ed5c09912b1d55d61d181cf8640b","observation_id":"4776660d-adb1-4ad3-975a-da4b14a28e88","resolution":{"observed_at":"2026-08-12T16:20:14.818518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.047677Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.047677Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:54b1d393bd19d8ab3c1e56964a211fedb4aab0c668a994cf24aeea0e256ea409","observation_id":"6f9af71f-4511-4291-833b-d5d342481dd3","resolution":{"observed_at":"2026-08-12T16:20:03.047677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.053659Z","title":"O., Pellauer, M., Emer, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.053659Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:f58494d6c98ac798b666efa2a125d35808bc9fc691e1bedd7e86c93c444b9024","observation_id":"9e5f5e38-9f5e-4c17-91e7-deeb4abb448b","resolution":{"observed_at":"2026-08-12T16:20:03.053659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.774122Z","title":"Dnnfusion: accelerating deep neural networks execution with advanced operator fusion","venue":null,"work_id":"52d10615-4012-4474-a56a-69c666154dc3","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.058778Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:4c8fb5098590360a9042ac87b2bdadcf9cdb1e845f19336cdd4f8444f8d9dae5","observation_id":"80725d92-7ce5-45de-855b-9582a78e3831","resolution":{"observed_at":"2026-08-12T16:20:14.782306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.064414Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.064414Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:5fda5959abb5c64591b795e524254907c2974965faa1d4f43b3c24fe489f83b3","observation_id":"5bfb9de1-0142-4b59-b842-07954cde34b8","resolution":{"observed_at":"2026-08-12T16:20:03.064414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.732323Z","title":"S., Chen, Y.-H., Ying, V","venue":null,"work_id":"4d14a2d7-9069-47ff-9de6-a46ce2c170b8","year":2019},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.069821Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:9d635175e9fcd213ed87a480dbe8961752a608ca692fdea2becc29de69bfad15","observation_id":"18194aa1-6223-4ac5-b4ad-e169f3f075fd","resolution":{"observed_at":"2026-08-12T16:20:14.738941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.706552Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"ba21f324-a79d-4b1a-9874-6e38766c49da","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.075016Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:5547a4db395410e2de8058cb25a7576cc15fec23907d79ab62fbda5ccd8eca54","observation_id":"87b29825-d987-4b8c-bc11-51cff97aba81","resolution":{"observed_at":"2026-08-12T16:20:14.713331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.080119Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.080119Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:65f821fe8df2fdd46079c33109b067bc8d7cd6ca072dbbaaff76022846cdceaa","observation_id":"add3a1c1-9f93-419c-b611-856cb36133aa","resolution":{"observed_at":"2026-08-12T16:20:03.080119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.671882Z","title":"Accelerating transformer-based deep learning models on fpgas using column balanced block pruning","venue":null,"work_id":"7b377a04-d1d6-4ba0-b8d2-b26b4858e54e","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.085645Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:9bcdaaa415d526195b0158364dfb0257881f92d127e1a467f219d577e8abd9ed","observation_id":"6c14337a-f0f9-4d91-968c-5edbfc34738b","resolution":{"observed_at":"2026-08-12T16:20:14.679219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.652005Z","title":"Sensimix: Sensitivity-aware 8-bit index & 1-bit value mixed precision quantization for bert compression","venue":null,"work_id":"2a59342f-7e47-404a-92e9-40c5a955096e","year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.090817Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:1e4e93aedffebd97084abbb007199c67b37700c8d308901acf958f0bf7b8f799","observation_id":"abd6822c-fb4f-494f-ba47-c296261c1175","resolution":{"observed_at":"2026-08-12T16:20:14.659045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-12T16:20:03.095869Z","title":"T., and Mildenhall, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.095869Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:447bbd3ecda71db1a3bf907ec046c705c0c09126199196d76939ed9e8226fb80","observation_id":"2872df2a-25f8-4999-9c0d-a0d25d4d3bc3","resolution":{"observed_at":"2026-08-12T16:20:03.095869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.101666Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.101666Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:3caa138d923b0abd849dad000879101b03299d496f7c07d00681c8f0f15a1f28","observation_id":"c136a145-3aa9-40d2-895f-ea5a9980a11a","resolution":{"observed_at":"2026-08-12T16:20:03.101666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.106594Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.106594Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:bd6c28e9fc16281a4be794cbfa4addccd8c447dd5140951f15110ce3e2296f7f","observation_id":"5f0c9c46-f664-4789-b55c-77084f7ee513","resolution":{"observed_at":"2026-08-12T16:20:03.106594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.111284Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.111284Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:4f1d8c25ae075db269847741fd50eb4f453880c909284efe961a33193a92c6ee","observation_id":"81203344-da31-447d-a4e6-1bf7e9f1b1e9","resolution":{"observed_at":"2026-08-12T16:20:03.111284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-15T12:00:53.251354Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-12T16:20:03.115971Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.115971Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:6a4bb528579430980811112058d5e7c3efee9438495bdae6a4df99c16173c65c","observation_id":"914bfc6f-707e-4d7c-9b13-2b7c03fa503a","resolution":{"observed_at":"2026-08-12T16:20:03.115971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-12T16:20:03.120751Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.120751Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:d4dc3ea5f7f6f6c2024e0eea6442bde8523fefdabc5ef146d0db3c8fa98fe939","observation_id":"e132c2de-bb0a-4801-8867-756b16a441cf","resolution":{"observed_at":"2026-08-12T16:20:03.120751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09355","last_updated":"2019-08-25T16:13:24Z","snapshot_observed_at":"2026-08-14T21:37:39.248967Z","submitted_at":"2019-08-25T16:13:24Z","title":"Patient Knowledge Distillation for BERT Model Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09355","snapshot_observed_at":"2026-08-12T16:20:03.125648Z","title":"Patient knowledge distillation for bert model compression","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.125648Z"},"links":{"cited_paper":"/paper/1908.09355","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:42b965eff90f18b728ee80643b484f7b37eaf4e6748c084ca7995deeb871b558","observation_id":"193681a3-7ed0-4996-90b7-2541e155a979","resolution":{"observed_at":"2026-08-12T16:20:03.125648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.586675Z","title":"Improving the efficiency of transformers for resource-constrained devices","venue":null,"work_id":"afb53dcd-3569-46b7-9f5b-9a4aa7c384be","year":2021},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.130572Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:1d42d2f7631132782824ab943d0a7394ed20131f61852463f589e5f292333822","observation_id":"664c87d5-e70c-47b7-a61e-c85db9a2556a","resolution":{"observed_at":"2026-08-12T16:20:14.593717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T16:20:03.135423Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.135423Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:af2d7c14f44210ced9d0fc7511b3f1bf43b775d17b2f28bd1d4023548833df2f","observation_id":"e2cb3bf3-da56-4378-aebe-8a4bd7979bea","resolution":{"observed_at":"2026-08-12T16:20:03.135423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.140419Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.140419Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:c31a1baac4acf5f1b3d1647ea7c29cdc33bf77a17d8443d4e29f3a7d42522c20","observation_id":"e10fc1db-b711-458e-92cd-fb706b1e38a6","resolution":{"observed_at":"2026-08-12T16:20:03.140419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-14T00:39:07.525303Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-12T16:20:03.145702Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.145702Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:ed86f2cea12c19ba9ef7dc9e09fdbbe250fc873b1f25237ec1a15e4ba590e84f","observation_id":"306620eb-8751-4452-8a76-eadb6a7025a0","resolution":{"observed_at":"2026-08-12T16:20:03.145702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.549070Z","title":"C., Venkataramani, S., Sen, S., Chen, C.-Y., El Maghraoui, K., Srinivasan, V","venue":null,"work_id":"5358034c-9ff7-4dff-bf43-a8a9e146ed29","year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.150817Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:3c20649d511df7c6e252864ecdfee6b5012cbb69926f95d1f23483dfca3858f4","observation_id":"4417ca96-4b92-4ad2-8bed-f169a120af87","resolution":{"observed_at":"2026-08-12T16:20:14.555143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.06097","last_updated":"2021-06-07T06:08:27Z","snapshot_observed_at":"2026-08-07T16:19:02.466270Z","submitted_at":"2020-09-13T22:09:30Z","title":"Cluster-Former: Clustering-based Sparse Transformer for Long-Range Dependency Encoding","version":2},"cited_work":{"arxiv_id":"2009.06097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.06097","snapshot_observed_at":"2026-08-12T16:20:03.314939Z","title":"Cluster-Former: Clustering-based Sparse Transformer for Long-Range Dependency Encoding","venue":"cs.CL","work_id":"41c316fc-17b3-4c2b-bdbb-f4bafd88da58","year":2020},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.156474Z"},"links":{"cited_paper":"/paper/2009.06097","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:123dff41466e4eeb84e3f6d08dc2cee9ec000561bcdd97b7865ed0771729a676","observation_id":"a0a64d52-cdb4-4bfd-a69e-d4999e7ed5dd","resolution":{"observed_at":"2026-08-12T16:20:03.324238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15828","last_updated":"2021-06-27T10:11:02Z","snapshot_observed_at":"2026-07-06T10:29:11.807491Z","submitted_at":"2020-12-31T18:51:26Z","title":"MiniLMv2: Multi-Head Self-Attention Relation Distillation for Compressing Pretrained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15828","snapshot_observed_at":"2026-08-12T16:20:03.161573Z","title":"Minilmv2: Multi-head self-attention relation distillation for compressing pretrained transformers","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.161573Z"},"links":{"cited_paper":"/paper/2012.15828","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:fe896689228eec50364a025d9074f9f54dac5a536e5d9b7a397c00e701ca6b2a","observation_id":"c5423b7d-d1a1-44ea-aa1f-3ca1828e13ba","resolution":{"observed_at":"2026-08-12T16:20:03.161573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.529102Z","title":"Minilm: Deep self-attention distillation for task-agnostic compression of pre-trained transformers","venue":null,"work_id":"a4f40d6f-75b0-4b60-b26c-f3b0c1737158","year":2020},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.166375Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:e4bcdcef3fbc74f0f864d5682eb26643fd403b0d4597522044df2e01bc267ad4","observation_id":"f84c3fab-eeba-4ecc-ab12-502be72f0fb8","resolution":{"observed_at":"2026-08-12T16:20:14.535907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.510335Z","title":"N., Emer, J","venue":null,"work_id":"fcbfe1bf-b0a5-41f6-9183-3c9c980ca9ef","year":2019},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.171117Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:f00659da279fa45933c6e84db82b4089a2c36094d4a6213f3f366d22514d52bc","observation_id":"08a15981-5a58-4b34-82d3-c8c6f209b796","resolution":{"observed_at":"2026-08-12T16:20:14.515715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.175603Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.175603Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:41826a114675be21699fe4b42b0218c956ecd37326b445adf44bb9063cea8716","observation_id":"d62d813a-88ba-48c8-b259-283f78199d63","resolution":{"observed_at":"2026-08-12T16:20:03.175603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.478794Z","title":"Boost vision transformer with gpu-friendly sparsity and quantization","venue":null,"work_id":"49ce9a6d-9b0f-40b5-9119-159b2005d151","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.180775Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:b6239ce615314a47e2c9a9ea1ddf8fdfe5195051d4acca467b983955030a30d0","observation_id":"7925b971-d851-4c7e-9663-1c097be4b72d","resolution":{"observed_at":"2026-08-12T16:20:14.485611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.459056Z","title":"Width & depth pruning for vision transformers","venue":null,"work_id":"13fa7d31-aba1-45b6-bb00-c343e55a0f54","year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.185884Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:75d662ad67d47ddfdf64de99b9794840661486b81c4e7836759ed425ada77a8d","observation_id":"88d768d8-3359-4ad1-b447-c23fdc91e314","resolution":{"observed_at":"2026-08-12T16:20:14.464747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08243","last_updated":"2022-03-15T20:38:22Z","snapshot_observed_at":"2026-08-13T16:22:28.364027Z","submitted_at":"2022-03-15T20:38:22Z","title":"Unified Visual Transformer Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08243","snapshot_observed_at":"2026-08-12T16:20:03.190444Z","title":"Unified visual transformer compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.190444Z"},"links":{"cited_paper":"/paper/2203.08243","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:6e8065f2039ac85f9a2da852b561d780359daa363d1b64e1144defb8d795ff4f","observation_id":"3f674856-9f03-4622-88b2-34a8b7de35e4","resolution":{"observed_at":"2026-08-12T16:20:03.190444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-13T04:56:53.111742Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-12T16:20:03.195310Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.195310Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:b13b2951d7a167b4b686abdbf92aa120dfa0b92dde8cc66134f4b085322f3f60","observation_id":"3653e378-8e32-4bd2-9629-a6609408d2bc","resolution":{"observed_at":"2026-08-12T16:20:03.195310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.440500Z","title":"Tileflow: A framework for modeling fusion dataflow via tree-based analysis","venue":null,"work_id":"1b06b660-8c96-4ced-b8d4-59c5edcf1b32","year":2023},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.200194Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:8fbcb482004d79a5e914bb3206bcf1213eb7b6564203a540a8813f919e2e8d06","observation_id":"1128f696-60b7-4e44-a028-c2562ea3a7bf","resolution":{"observed_at":"2026-08-12T16:20:14.446934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:14.419981Z","title":"and Yang, K","venue":null,"work_id":"048a79ce-0ab7-40e5-bde3-e42291a0f01a","year":2022},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.204980Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:69f6f28049d296fd7e3a5ae975e10eae4041f0214b9106935f9a7c59bfc2b9a4","observation_id":"4f5c5103-a284-4dfd-8fe5-48f6e81bd9de","resolution":{"observed_at":"2026-08-12T16:20:14.426817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:03.210254Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T16:20:03.210254Z"},"links":{"citing_paper":"/paper/2411.17720"},"observation_digest":"sha256:9e98d04daa429dcd7cc57026f02157849ac3dde4c64f9f7fe7340de69632ec69","observation_id":"55b38dc0-c758-4f83-a6cd-dfa2cea1fcca","resolution":{"observed_at":"2026-08-12T16:20:03.210254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17720","last_updated":"2025-05-16T00:56:30Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-14T21:38:16.727688Z","submitted_at":"2024-11-20T19:44:26Z","title":"MAS-Attention: Memory-Aware Stream Processing for Attention Acceleration on Resource-Constrained Edge Devices"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2411.17720."}