{"as_of":"2026-08-09T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6acdda3fab39115b7c790bde9bfe2f4d36bfa02a3a5f88c1fe85ecce1a5a740","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:14:34.248578Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.09010/citation-record","integrity":"/paper/2507.09010/integrity","json":"/paper/2507.09010/citation-record.json","paper":"/paper/2507.09010"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T18:14:30.679512Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.679512Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:fbad3765eaae3b01337edb4f03e65ab57426e9ea6333bab5013eb75299a46768","observation_id":"125dcfd3-a8ce-415c-aff3-bf46e1c0c658","resolution":{"observed_at":"2026-08-06T18:14:30.679512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.820331Z","title":"Architecting an energy-efficient dram system for gpus,","venue":null,"work_id":"ad8636e0-3c10-430a-8945-dd2d121336de","year":2017},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.781016Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:85811380812b71624b3668ed91982f3ee787ffd805367f65385b759cfb981ce1","observation_id":"6a46ac35-ff27-42bf-88d0-41f738ec937c","resolution":{"observed_at":"2026-08-06T18:14:37.886190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9329.36559","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:34.675752Z","title":"Sparc: Token similarity-aware sparse attention transformer accelerator via row- wise clustering,","venue":null,"work_id":"ce532f18-d84d-4384-a5b6-d4385e71c29f","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.882849Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:cebe5b086e672ff6ebb3fa8d5609565072e5e9cf3a7ae66ac18abbbe6f447cd8","observation_id":"a25e08c6-6864-44fe-a9c9-88abd2013d9d","resolution":{"observed_at":"2026-08-06T18:14:34.814240Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.638358Z","title":"Vs-quant: Per-vector scaled quantization for accurate low-precision neural network inference,","venue":null,"work_id":"9eca96a5-b466-4db8-9ca9-7477276038e5","year":2021},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:30.998677Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:b301094a08af9b39ab1b4a9e9456ac28c35f5f7976a248fad4cecc5212616851","observation_id":"34755e6b-31d8-4b32-94d9-815620da707c","resolution":{"observed_at":"2026-08-06T18:14:37.732439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.417175Z","title":"Transformers are ssms: generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"1226c8f5-799e-4a3c-a008-9f69a31d4fa3","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.160451Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:525783bd44172a66f7419ca28ef237d609b724b9bc77814015fdbf7314ee3998","observation_id":"3a0cdbe1-cfcc-48f5-b0d1-54c28458854c","resolution":{"observed_at":"2026-08-06T18:14:37.500968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:14:31.335666Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.335666Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:50d30f543dc1fba5643323a62611504e1fc9bc96f6a69537abf868ac6179b32b","observation_id":"66c0df4d-6f78-4f89-ba81-79b91d88541e","resolution":{"observed_at":"2026-08-06T18:14:31.335666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-06T18:14:31.524697Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.524697Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:aa16a656d58d2f5c43cfd99ce307269e313f0c2817fc54e4fa0cb32abd31d836","observation_id":"3784dc49-c9c0-4a86-8470-cbfb4a3b2835","resolution":{"observed_at":"2026-08-06T18:14:31.524697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:37.138579Z","title":"Ita: An energy-efficient attention and softmax accelerator for quantized transformers,","venue":null,"work_id":"ab998e46-ff88-4612-acb9-050fcf85ae9c","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.678953Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:183cbfe1fe51272668ec750d32f182dfea41e006d7a47199d5eaf1732b7d240d","observation_id":"d8bc71ae-75fa-4932-9ac9-b44e22b27322","resolution":{"observed_at":"2026-08-06T18:14:37.287077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.939296Z","title":"A 95.6-tops/w deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,","venue":null,"work_id":"6603a3b0-f1c6-4dcf-bc5e-4f1d1ff36a01","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.808138Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:6a4ca068eaee2008fde301e95926da898810724989fc240f195a785dcd18c4bf","observation_id":"6ae7e611-7543-4731-9974-a386988a59ee","resolution":{"observed_at":"2026-08-06T18:14:37.034304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.780414Z","title":"A modular digital vlsi flow for high-productivity soc design,","venue":null,"work_id":"97ff0c41-73a8-421c-9243-21f5bdf170bf","year":2018},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:31.943718Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:7ebf889925014c3dba500d3805b1e2a910d131c545faab6d25299b39532127e4","observation_id":"fdb2cc5d-6404-4b53-92de-dc385ed4ba1b","resolution":{"observed_at":"2026-08-06T18:14:36.873081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.577879Z","title":null,"venue":null,"work_id":"713ff3e0-4d2c-4500-bd7f-9aedb8dfe981","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.130864Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:8fc65ab2e5f6c30ff3b3f42360c1afe15e35a1b23dc31be7b94b41c5e6a86c73","observation_id":"b8d9e08d-f57f-4dab-931e-5d180b80849e","resolution":{"observed_at":"2026-08-06T18:14:36.700328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-09T20:48:10.014716Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-06T18:14:32.263418Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.263418Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:911701731a0c9a14d7d3ed1d8980e555e795fa4102fba54bc14c97ecb9a720d7","observation_id":"0387f486-e94f-49c8-8ebe-fc057f5bc4cd","resolution":{"observed_at":"2026-08-06T18:14:32.263418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.437772Z","title":"Bucket getter: A bucket-based processing engine for low-bit block floating point (bfp) dnns,","venue":null,"work_id":"00c61728-8156-40a7-a8e5-29c237d2e560","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.395489Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:152b399e8d24f62aa60125c57edc3df512982b1aae080ad4b8a86a8962551dbb","observation_id":"def74e63-7de3-44bf-a8cb-f29f4cb1ce2f","resolution":{"observed_at":"2026-08-06T18:14:36.503663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:32.553413Z","title":"Pointer sentinel mixture models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.553413Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:441bc37c95ce08100b584e5d60d97984214d79a8f721dd9af67d6937e0ad76d3","observation_id":"16c20b43-0be1-4b68-9fb2-77ac679ae042","resolution":{"observed_at":"2026-08-06T18:14:32.553413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.287362Z","title":"A 127.8 tops/w arbitrarily quantized 1-to-8b scalable-precision accelerator for general-purpose deep learning with reduction of storage, logic and latency waste,","venue":null,"work_id":"2bbe58e7-9ba8-4880-91a7-35657ea24f83","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.750560Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:2f62e6448392c8498c8486e2b0e05012a73aace220320cd4c2f575426cc772da","observation_id":"81e4aa70-d83f-4540-996b-5287005ee479","resolution":{"observed_at":"2026-08-06T18:14:36.352125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06023","last_updated":"2016-08-26T16:13:13Z","snapshot_observed_at":"2026-07-30T19:30:50.474373Z","submitted_at":"2016-02-19T02:04:18Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.06023","snapshot_observed_at":"2026-08-06T18:14:32.895076Z","title":"Abstractive text summarization using sequence-to-sequence rnns and beyond,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:32.895076Z"},"links":{"cited_paper":"/paper/1602.06023","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:10de2011971aa06e6d9c32f97299ae0b5450449ccf6bcd3b60c77fbf113bde3a","observation_id":"68ca6f1a-0c32-4cd3-aa27-8741e8d6070b","resolution":{"observed_at":"2026-08-06T18:14:32.895076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:36.098019Z","title":"Nvidia jetson orin nano,","venue":null,"work_id":"725db7bc-d7ed-45a6-99c5-13ac634ec3b1","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.022172Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:0b79ce5e9fd70472e3d7acf543203ec1c708b66823edbae131556c061c8b9900","observation_id":"defed1f5-5f58-4e28-b12b-ed08d7d6e9d7","resolution":{"observed_at":"2026-08-06T18:14:36.207990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.877896Z","title":"Fine-grained dram: Energy-efficient dram for extreme bandwidth systems,","venue":null,"work_id":"4ee79755-79e6-42d7-8c30-518e2223b4cb","year":2017},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.116701Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:d5d6d7a2ec5e6ff9852082e57e2680592a81280a4f142426c8cd4248d91d1ac7","observation_id":"70b8b192-fcd8-4095-a1ae-e25967db41e1","resolution":{"observed_at":"2026-08-06T18:14:35.961479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.716339Z","title":"Fact: Ffn-attention co-optimized transformer architecture with eager correlation prediction,","venue":null,"work_id":"e2b9f61e-1f73-4c10-9af5-6e37229e3e3b","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.205827Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:2cc150fac6cd7a743a96d88ba6474b73edfc6b11404d79b1f25b7a610d391701","observation_id":"20372408-fd1a-45c2-a80b-55319903ab74","resolution":{"observed_at":"2026-08-06T18:14:35.792388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.537758Z","title":"Mecla: Memory-compute-efficient llm accelerator with scaling sub-matrix partition,","venue":null,"work_id":"2e07d6c8-0649-47da-b1dd-bbcd5bc81d1e","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.352616Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:a3acb10713e112f81e7c11c42a866d5eec5ea4c077b060290bc26da9817e4f2f","observation_id":"94c2d3bf-c2c2-4fa2-bfb2-d7bc4e72f9ce","resolution":{"observed_at":"2026-08-06T18:14:35.605872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-06T18:14:33.447407Z","title":"Microscaling data formats for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.447407Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:5f1d3777a7488e0e77dcde072eb5d2d7166a284d347fac7b31089abc915bf23a","observation_id":"260f865f-bf22-41ba-941c-9f2c8516265b","resolution":{"observed_at":"2026-08-06T18:14:33.447407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:33.587252Z","title":"Roformer: En- hanced transformer with rotary position embedding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.587252Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:a44419ffc59d0185b58760be833fe66b478d06e5490b01d4d87fdff1b0bf6b58","observation_id":"9bc362b9-8a4e-4af1-ba6e-438221315542","resolution":{"observed_at":"2026-08-06T18:14:33.587252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-06T18:14:33.692647Z","title":"Retentive network: A successor to transformer for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.692647Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:48071cecf7d7b71062fd8e76f78bcd574bb5fa7c5bf5e56ae686ddd1f75f5112","observation_id":"07c632fd-f886-4442-81de-7ebd830008e7","resolution":{"observed_at":"2026-08-06T18:14:33.692647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:14:33.762234Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.762234Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:761fa54b0aa103f552d3baede473f30e5c675b24e9525b2ce54269e6b77154dc","observation_id":"ffd7964c-373e-45db-95dc-293c43766d5f","resolution":{"observed_at":"2026-08-06T18:14:33.762234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.318529Z","title":"Sole: Hardware-software co-design of softmax and layernorm for efficient transformer inference,","venue":null,"work_id":"ebdca7ee-6b4c-4683-8ffb-9d1f95b3f059","year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.859677Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:8a9c312cdf0b9b121ae49fce4398215c77e8bbb30ebb8b5d0e2aaf88a0e61195","observation_id":"44f1cfe7-9c9c-4ac1-b62e-a6cc49823000","resolution":{"observed_at":"2026-08-06T18:14:35.383466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:33.974593Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:33.974593Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:6b431741c8f8bfd60bdb0301f4514194d9daf8acec7408a73f0559dea2a71645","observation_id":"2079e212-5704-4a29-b94c-6110d504a9e2","resolution":{"observed_at":"2026-08-06T18:14:33.974593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:35.107237Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":"f7cd361c-b45b-492a-9a78-51276d8b1f2f","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:34.118676Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:0be6bed2882f84dc1ba3e55931447e983b41b541d769935d90c61ff4e04a48ef","observation_id":"fb639e50-da2a-4437-85b3-05ef8531e8da","resolution":{"observed_at":"2026-08-06T18:14:35.216617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:14:34.894428Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":"359aec27-8eb6-4893-a166-1a1a8794f103","year":2024},"citing_paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:14:34.248578Z"},"links":{"citing_paper":"/paper/2507.09010"},"observation_digest":"sha256:681c2ee7ad454d6e10804d244a0730f878118a7128f5a157c144855c53322fc6","observation_id":"be55cd61-3724-4471-a10a-d6df02d4d13d","resolution":{"observed_at":"2026-08-06T18:14:35.002544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.09010","last_updated":"2025-07-11T20:27:30Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-08T01:48:18.722166Z","submitted_at":"2025-07-11T20:27:30Z","title":"Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.09010."}