Pith. sign in

Paper Citation Record · LEDGER

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference

As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2507.09010.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.09010 v1

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:14:34.248578Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

28 of 28 outbound references displayed

  • verified exact0
  • verified fuzzy15
  • unresolved12
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 125dcfd3-a8ce-415c-aff3-bf46e1c0c658 · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:30.679512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:30.679512Z digest=sha256:fbad3765eaae3b01337edb4f03e65ab57426e9ea6333bab5013eb75299a46768

Observation 6a46ac35-ff27-42bf-88d0-41f738ec937c · outbound

This paper cites Architecting an energy-efficient dram system for gpus,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Architecting an energy-efficient dram system for gpus,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.886190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:30.781016Z digest=sha256:85811380812b71624b3668ed91982f3ee787ffd805367f65385b759cfb981ce1

Observation a25e08c6-6864-44fe-a9c9-88abd2013d9d · outbound

This paper cites Sparc: Token similarity-aware sparse attention transformer accelerator via row- wise clustering,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Sparc: Token similarity-aware sparse attention transformer accelerator via row- wise clustering,

Reference 3

Resolution
metadata mismatch
raw_fallback, observed 2026-08-06T18:14:34.814240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:30.882849Z digest=sha256:cebe5b086e672ff6ebb3fa8d5609565072e5e9cf3a7ae66ac18abbbe6f447cd8

Observation 34755e6b-31d8-4b32-94d9-815620da707c · outbound

This paper cites Vs-quant: Per-vector scaled quantization for accurate low-precision neural network inference,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Vs-quant: Per-vector scaled quantization for accurate low-precision neural network inference,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.732439Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:30.998677Z digest=sha256:b301094a08af9b39ab1b4a9e9456ac28c35f5f7976a248fad4cecc5212616851

Observation 3a0cdbe1-cfcc-48f5-b0d1-54c28458854c · outbound

This paper cites Transformers are ssms: generalized models and efficient algorithms through structured state space duality,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Transformers are ssms: generalized models and efficient algorithms through structured state space duality,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.500968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:31.160451Z digest=sha256:525783bd44172a66f7419ca28ef237d609b724b9bc77814015fdbf7314ee3998

Observation 66c0df4d-6f78-4f89-ba81-79b91d88541e · outbound

This paper cites The Llama 3 Herd of Models.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference The Llama 3 Herd of Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:31.335666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:31.335666Z digest=sha256:50d30f543dc1fba5643323a62611504e1fc9bc96f6a69537abf868ac6179b32b

Observation 3784dc49-c9c0-4a86-8470-cbfb4a3b2835 · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:31.524697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:31.524697Z digest=sha256:aa16a656d58d2f5c43cfd99ce307269e313f0c2817fc54e4fa0cb32abd31d836

Observation d8bc71ae-75fa-4932-9ac9-b44e22b27322 · outbound

This paper cites Ita: An energy-efficient attention and softmax accelerator for quantized transformers,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Ita: An energy-efficient attention and softmax accelerator for quantized transformers,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.287077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:31.678953Z digest=sha256:183cbfe1fe51272668ec750d32f182dfea41e006d7a47199d5eaf1732b7d240d

Observation 6ae7e611-7543-4731-9974-a386988a59ee · outbound

This paper cites A 95.6-tops/w deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference A 95.6-tops/w deep learning inference accelerator with per-vector scaled 4-bit quantization in 5 nm,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:37.034304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:31.808138Z digest=sha256:6a4ca068eaee2008fde301e95926da898810724989fc240f195a785dcd18c4bf

Observation fdb2cc5d-6404-4b53-92de-dc385ed4ba1b · outbound

This paper cites A modular digital vlsi flow for high-productivity soc design,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference A modular digital vlsi flow for high-productivity soc design,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.873081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:31.943718Z digest=sha256:7ebf889925014c3dba500d3805b1e2a910d131c545faab6d25299b39532127e4

Observation b8d9e08d-f57f-4dab-931e-5d180b80849e · outbound

This paper cites an unresolved cited work.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-06T18:14:36.700328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:32.130864Z digest=sha256:8fc65ab2e5f6c30ff3b3f42360c1afe15e35a1b23dc31be7b94b41c5e6a86c73

Observation 0387f486-e94f-49c8-8ebe-fc057f5bc4cd · outbound

This paper cites QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:32.263418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:32.263418Z digest=sha256:81d5b0d53a02643b76c4beba973a674f1f63fffa51c1f5949d5bb499644de603

Observation def74e63-7de3-44bf-a8cb-f29f4cb1ce2f · outbound

This paper cites Bucket getter: A bucket-based processing engine for low-bit block floating point (bfp) dnns,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Bucket getter: A bucket-based processing engine for low-bit block floating point (bfp) dnns,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.503663Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:32.395489Z digest=sha256:152b399e8d24f62aa60125c57edc3df512982b1aae080ad4b8a86a8962551dbb

Observation 16c20b43-0be1-4b68-9fb2-77ac679ae042 · outbound

This paper cites Pointer sentinel mixture models,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Pointer sentinel mixture models,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:32.553413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:32.553413Z digest=sha256:441bc37c95ce08100b584e5d60d97984214d79a8f721dd9af67d6937e0ad76d3

Observation 81e4aa70-d83f-4540-996b-5287005ee479 · outbound

This paper cites A 127.8 tops/w arbitrarily quantized 1-to-8b scalable-precision accelerator for general-purpose deep learning with reduction of storage, logic and latency waste,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference A 127.8 tops/w arbitrarily quantized 1-to-8b scalable-precision accelerator for general-purpose deep learning with reduction of storage, logic and latency waste,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.352125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:32.750560Z digest=sha256:2f62e6448392c8498c8486e2b0e05012a73aace220320cd4c2f575426cc772da

Observation 68ca6f1a-0c32-4cd3-aa27-8741e8d6070b · outbound

This paper cites Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:32.895076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:32.895076Z digest=sha256:10de2011971aa06e6d9c32f97299ae0b5450449ccf6bcd3b60c77fbf113bde3a

Observation defed1f5-5f58-4e28-b12b-ed08d7d6e9d7 · outbound

This paper cites Nvidia jetson orin nano,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Nvidia jetson orin nano,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:36.207990Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:33.022172Z digest=sha256:0b79ce5e9fd70472e3d7acf543203ec1c708b66823edbae131556c061c8b9900

Observation 70b8b192-fcd8-4095-a1ae-e25967db41e1 · outbound

This paper cites Fine-grained dram: Energy-efficient dram for extreme bandwidth systems,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Fine-grained dram: Energy-efficient dram for extreme bandwidth systems,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.961479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:33.116701Z digest=sha256:d5d6d7a2ec5e6ff9852082e57e2680592a81280a4f142426c8cd4248d91d1ac7

Observation 20372408-fd1a-45c2-a80b-55319903ab74 · outbound

This paper cites Fact: Ffn-attention co-optimized transformer architecture with eager correlation prediction,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Fact: Ffn-attention co-optimized transformer architecture with eager correlation prediction,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.792388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:33.205827Z digest=sha256:2cc150fac6cd7a743a96d88ba6474b73edfc6b11404d79b1f25b7a610d391701

Observation 94c2d3bf-c2c2-4fa2-bfb2-d7bc4e72f9ce · outbound

This paper cites Mecla: Memory-compute-efficient llm accelerator with scaling sub-matrix partition,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Mecla: Memory-compute-efficient llm accelerator with scaling sub-matrix partition,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.605872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:33.352616Z digest=sha256:a3acb10713e112f81e7c11c42a866d5eec5ea4c077b060290bc26da9817e4f2f

Observation 260f865f-bf22-41ba-941c-9f2c8516265b · outbound

This paper cites Microscaling Data Formats for Deep Learning.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Microscaling Data Formats for Deep Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.447407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.447407Z digest=sha256:5f1d3777a7488e0e77dcde072eb5d2d7166a284d347fac7b31089abc915bf23a

Observation 9bc362b9-8a4e-4af1-ba6e-438221315542 · outbound

This paper cites Roformer: En- hanced transformer with rotary position embedding,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Roformer: En- hanced transformer with rotary position embedding,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.587252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.587252Z digest=sha256:a44419ffc59d0185b58760be833fe66b478d06e5490b01d4d87fdff1b0bf6b58

Observation 07c632fd-f886-4442-81de-7ebd830008e7 · outbound

This paper cites Retentive Network: A Successor to Transformer for Large Language Models.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Retentive Network: A Successor to Transformer for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.692647Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.692647Z digest=sha256:48071cecf7d7b71062fd8e76f78bcd574bb5fa7c5bf5e56ae686ddd1f75f5112

Observation ffd7964c-373e-45db-95dc-293c43766d5f · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.762234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.762234Z digest=sha256:761fa54b0aa103f552d3baede473f30e5c675b24e9525b2ce54269e6b77154dc

Observation 44f1cfe7-9c9c-4ac1-b62e-a6cc49823000 · outbound

This paper cites Sole: Hardware-software co-design of softmax and layernorm for efficient transformer inference,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Sole: Hardware-software co-design of softmax and layernorm for efficient transformer inference,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.383466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:33.859677Z digest=sha256:8a9c312cdf0b9b121ae49fce4398215c77e8bbb30ebb8b5d0e2aaf88a0e61195

Observation 2079e212-5704-4a29-b94c-6110d504a9e2 · outbound

This paper cites Smoothquant: Accurate and efficient post-training quantization for large language models,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Smoothquant: Accurate and efficient post-training quantization for large language models,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T18:14:33.974593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:14:33.974593Z digest=sha256:6b431741c8f8bfd60bdb0301f4514194d9daf8acec7408a73f0559dea2a71645

Observation fb639e50-da2a-4437-85b3-05ef8531e8da · outbound

This paper cites Llmcompass: Enabling efficient hardware design for large language model inference,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Llmcompass: Enabling efficient hardware design for large language model inference,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.216617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:34.118676Z digest=sha256:0be6bed2882f84dc1ba3e55931447e983b41b541d769935d90c61ff4e04a48ef

Observation be55cd61-3724-4471-a10a-d6df02d4d13d · outbound

This paper cites Atom: Low-bit quantization for efficient and accurate llm serving,.

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference Atom: Low-bit quantization for efficient and accurate llm serving,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:14:35.002544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-06T18:14:34.248578Z digest=sha256:681c2ee7ad454d6e10804d244a0730f878118a7128f5a157c144855c53322fc6

Pith citing papers

No inbound Pith citation observations are available.