Pith. sign in

Paper Citation Record · LEDGER

Accelerating Large Language Models through Partially Linear Feed-Forward Network

As of 13 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2501.10054.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.10054 v1

Coverage vector

measured 70 of 70 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T19:29:57.522816Z

measured 70 of 70 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

70 of 70 outbound references displayed

  • verified exact0
  • verified fuzzy46
  • unresolved23
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 47ae6c4c-283a-4f1e-9acf-e30db799f366 · outbound

This paper cites org/wiki/Constant_folding.

Accelerating Large Language Models through Partially Linear Feed-Forward Network org/wiki/Constant_folding

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.888357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.147657Z digest=sha256:54d668ab919ec3957bd9bc8ca8257e85a2315c839d26566df5e6d0b105bf588f

Observation 55d8c0b9-e687-4110-8705-e7aae8c255d7 · outbound

This paper cites [Online; accessed 2024- 11-01].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2024- 11-01]

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.872640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.154692Z digest=sha256:c2ff52f2324d03956f4c9337c756eb830ae02fbd5eadbc04ddbbdf5771ddee17

Observation 56ef685d-66dd-4872-95bb-ee4cf618b79d · outbound

This paper cites [Online; ac- cessed 2025-01-09].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; ac- cessed 2025-01-09]

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.856969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.159847Z digest=sha256:6686a4552a7a3f6d02a74a494b7022a7a8fd564ff680729fad46be932d0d1571

Observation 686e192f-7b29-4b0b-a239-ada71ce30b8a · outbound

This paper cites https://gcc.gnu.org/onlinedocs/gcc/ Optimize-Options.html.

Accelerating Large Language Models through Partially Linear Feed-Forward Network https://gcc.gnu.org/onlinedocs/gcc/ Optimize-Options.html

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.840892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.165422Z digest=sha256:175aa43c0b1ad10e968d40b6caec2e5ece1e938facbb4d1f1f60f1f56198d23f

Observation f4881877-eaa7-4200-bd99-cd7d376b614b · outbound

This paper cites https://github.com/python/cpython?tab= readme-ov-file.

Accelerating Large Language Models through Partially Linear Feed-Forward Network https://github.com/python/cpython?tab= readme-ov-file

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.823182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.171570Z digest=sha256:25ab5fbed2f78cacaab603c924b2ad24c50f3ae08929012c65c3d500170bc162

Observation d15c553d-6a0f-44a9-a9a5-443a57333b4e · outbound

This paper cites [Online; accessed 2024-11-24].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2024-11-24]

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.803467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.176789Z digest=sha256:f0476d35de3b69d85ac9078a23f335a89772fce885a6bb2d77034c632fc03e58

Observation 258f282e-e002-4763-8c7e-f22858ebea94 · outbound

This paper cites [Online; accessed 2025-01-14].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2025-01-14]

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.786582Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.183553Z digest=sha256:77408b02fca887e6acd7bc9691e384d6cf0a10c6c516b067dab4a9eb4da24f35

Observation b697275b-1576-48bc-b4a7-87f5c83864ac · outbound

This paper cites [Online; accessed 2024-12-16].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2024-12-16]

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.770903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.189683Z digest=sha256:77f7dda6a4511a65100be7fea8e37e733e0035d18f9115c892ef28cfebb0904f

Observation b3ca9336-7a7b-4891-b59e-1e533fe61770 · outbound

This paper cites apache.org/sql/.

Accelerating Large Language Models through Partially Linear Feed-Forward Network apache.org/sql/

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.754438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.198549Z digest=sha256:fdb95b7fb0b36b8c98c505df6b2c5cb11e1e008b18145f16b6dacfc9b7341665

Observation f11c88ed-e790-4a31-99d8-9faa3c59d64a · outbound

This paper cites https://huggingface.co/docs/ transformers/index.

Accelerating Large Language Models through Partially Linear Feed-Forward Network https://huggingface.co/docs/ transformers/index

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.738207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.205585Z digest=sha256:ddce63aec7085135f96adf213092579f34c48d0f6137da372f55c23f50f99fcb

Observation bbbec6b4-63bf-4896-afab-21dc14a73e46 · outbound

This paper cites https://docs.rapids.ai/api/ cuml/stable/.

Accelerating Large Language Models through Partially Linear Feed-Forward Network https://docs.rapids.ai/api/ cuml/stable/

Reference 11

Resolution
malformed identifier
raw_fallback, observed 2026-08-10T19:29:58.718415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.210748Z digest=sha256:8de86f8163e2db9c41a20cc5e649d7f659090be6c707c7fef97140712be15d87

Observation 010db526-213b-4a13-863c-b8a8ac4d08ba · outbound

This paper cites [Online; accessed 2025-01-09].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2025-01-09]

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.697082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.216185Z digest=sha256:b83be22de3b328e6cbfd3b917b6fcb94db14b1e8cf954f2e28ac9604459743c5

Observation 1c70fca2-9dc9-4be8-bea8-015e1d594fab · outbound

This paper cites [Online; accessed 2024-11-01].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2024-11-01]

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.675134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.221111Z digest=sha256:904c94462d6bfadbbbb9c929d47d5579bece9b5cbe42b76f6518e2541acfd861

Observation 6cd4a652-4e7e-4b9d-ad5d-9e01c31131e7 · outbound

This paper cites an unresolved cited work.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-10T19:29:58.534923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.226076Z digest=sha256:fef69caa7c4abbee65e9d4ad8078c76a94a402cd0edc6e0b9426557689474e00

Observation 4b978dbe-baaa-4f16-bbf0-1369b183af35 · outbound

This paper cites [Online; ac- cessed 2025-01-13].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; ac- cessed 2025-01-13]

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.490506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.236415Z digest=sha256:ebd1bf7b6eecdfb7e13aa77092eca0e6387f7ec41f571778612abe1792797682

Observation bff2270c-2764-47fa-b352-87e0f84d5b2e · outbound

This paper cites [On- line; accessed 2025-01-09].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [On- line; accessed 2025-01-09]

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.472818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.244570Z digest=sha256:fb107c6b7c9f97819820afa802fcd548c2b20f0fe89cd908f696928fd1427a04

Observation 88f6008b-4556-4b6c-9501-13585b7a9590 · outbound

This paper cites [Online; accessed 2025-01-09].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2025-01-09]

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.456927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.249466Z digest=sha256:6e9677a3e23eb66fe631d246722ee3ec24682b3f36ee521a1f1569dedd84587b

Observation f68de9b5-8556-493f-bb2a-c550855ce721 · outbound

This paper cites [Online; accessed 2025-01-08].

Accelerating Large Language Models through Partially Linear Feed-Forward Network [Online; accessed 2025-01-08]

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.439339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.254987Z digest=sha256:41a0b2a1a88563b7c51a5ead77e455e9b3f62e4edbfa8155c36795766464950e

Observation b4b13c58-2e90-40d2-a3d1-7788b69cd37f · outbound

This paper cites The falcon series of open language models, 2023.

Accelerating Large Language Models through Partially Linear Feed-Forward Network The falcon series of open language models, 2023

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.416389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.260921Z digest=sha256:c8350c3a772dcbcc75c5e4886693524de7b04324d8059a599e42bac0697adb13

Observation b27dfc9a-5afb-407a-8e45-e09b9b3961f3 · outbound

This paper cites Piqa: Reasoning about physical commonsense in natural language.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Piqa: Reasoning about physical commonsense in natural language

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.266092Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.266092Z digest=sha256:be98717b4ad2f054bff1898d342dfeb5f7406b3be27ea35bb92b7e92798fa3b8

Observation 017692bf-2f49-48e6-956a-d395eeab2110 · outbound

This paper cites Language Models are Few-Shot Learners.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Language Models are Few-Shot Learners

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.271270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.271270Z digest=sha256:9d1b85ae5395ce2cdb60a0238a919df5e065e7b50ee1a996e3540fb74bd0c818

Observation 4fe328c4-ecac-403e-9e30-8f3396adca7f · outbound

This paper cites DSFormer: Effective Compression of Text-Transformers by Dense-Sparse Weight Factorization.

Accelerating Large Language Models through Partially Linear Feed-Forward Network DSFormer: Effective Compression of Text-Transformers by Dense-Sparse Weight Factorization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.276290Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.276290Z digest=sha256:0217736f729d200c888de773d83ec5b66d0cbed50501594095ad8356d0e1565c

Observation fd6b491b-2a39-4729-8837-64d16d867ec8 · outbound

This paper cites Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs).

Accelerating Large Language Models through Partially Linear Feed-Forward Network Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs)

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.281478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.281478Z digest=sha256:716f8acb1bddcc6fd35bafe7731309fe9ddb6862413cf528dbb1d3b6eb658fe1

Observation fee8dd64-3654-468a-a685-0ded02614e57 · outbound

This paper cites Language modeling with gated convolutional networks.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Language modeling with gated convolutional networks

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.382599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.287744Z digest=sha256:a8b217e6c8ec3ec0b0e6c50506bf9d956104de8b6bed56db00c4b1fcf97c779f

Observation fdb5e811-bcee-4fb0-9bc1-7163780e91f5 · outbound

This paper cites Llm.int8(): 8-bit matrix multiplication for transformers at scale.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Llm.int8(): 8-bit matrix multiplication for transformers at scale

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.364075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.293446Z digest=sha256:1f02f6156fa948da1c8fd12d5c0677cacc20ab8d584a22075de0ffbd4a997b53

Observation 154393a1-edb9-481e-9196-f3b62b4bdda5 · outbound

This paper cites The Llama 3 Herd of Models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network The Llama 3 Herd of Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.298769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.298769Z digest=sha256:5ec87a16469117328fab7c46c12baa9ad07f635639055e9ee0c5969b9412135b

Observation dc653491-8c84-4b7e-9393-42bd93d952fa · outbound

This paper cites Sigmoid- weighted linear units for neural network function ap- proximation in reinforcement learning.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Sigmoid- weighted linear units for neural network function ap- proximation in reinforcement learning

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.346146Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.304574Z digest=sha256:e7c5293a4327eb23bf7da19f5b3b1d435918e369499d3ad77dba093bae796437

Observation 5c263d24-44cb-4662-9dfb-f2adc114ba08 · outbound

This paper cites Optq: Accurate quantization for generative pre-trained transformers.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Optq: Accurate quantization for generative pre-trained transformers

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.323329Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.309622Z digest=sha256:83b7e32dd91fe317ddd9b38076764c185d7dbca84468b83b6674cb7787d714d5

Observation 71bedc88-247f-47da-ba68-465f7b400241 · outbound

This paper cites Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.304420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.315347Z digest=sha256:9491e1afe27250f2c42dfbf8dff1957d4f3d2c03d2dbea5365c929166118c8e6

Observation 397f3daa-a141-4857-8a3c-a925630621b3 · outbound

This paper cites A framework for few-shot language model evaluation, 07 2024.

Accelerating Large Language Models through Partially Linear Feed-Forward Network A framework for few-shot language model evaluation, 07 2024

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.320726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.320726Z digest=sha256:cd9b0a23bd9c2b0a6d031c62c4ee5b4d4d4fb2d53ba4cef3be95bd2c01ead424

Observation 432917f4-daa3-4f17-ab2b-76eaafc1b8e9 · outbound

This paper cites MiniLLM: On-Policy Distillation of Large Language Models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network MiniLLM: On-Policy Distillation of Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.326671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.326671Z digest=sha256:82150f56f9e73a0a1ce84d7dc91374fbd5ef87090cff72d5f7933170d434ecca

Observation 90c98b53-7fd3-4a8e-8af1-59f0c6f11aee · outbound

This paper cites How to access global memory efficiently in cuda c/c++ kernels | nvidia technical blog, 4 2014.

Accelerating Large Language Models through Partially Linear Feed-Forward Network How to access global memory efficiently in cuda c/c++ kernels | nvidia technical blog, 4 2014

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.274639Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.332094Z digest=sha256:1583158a8021c96f9713e8938e74074bd9ddb2ee4dada911ddc03e6535ac8ef5

Observation f750f5dc-3400-42b7-8dcc-2652d26c3692 · outbound

This paper cites Gaussian Error Linear Units (GELUs).

Accelerating Large Language Models through Partially Linear Feed-Forward Network Gaussian Error Linear Units (GELUs)

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.337129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.337129Z digest=sha256:3d1ac99f009451d87d40b9feea29a81812ac94039cc51df44b20b82c74794e98

Observation 0e47903f-e0b9-494a-8a65-9aed501f3e0a · outbound

This paper cites FineQuant: Unlocking Efficiency with Fine-Grained Weight-Only Quantization for LLMs.

Accelerating Large Language Models through Partially Linear Feed-Forward Network FineQuant: Unlocking Efficiency with Fine-Grained Weight-Only Quantization for LLMs

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.342704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.342704Z digest=sha256:fa42cd29716126080a3b794c21c4c7016ad4d798c2fafe327757e9269e45459e

Observation d7d81d1e-463c-4a16-921d-6908ca8824ed · outbound

This paper cites Self-normalizing neural networks.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Self-normalizing neural networks

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.257335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.347896Z digest=sha256:73065148c40fb8cd8f5029d9f64182b86c3c65908078ac30d7d122bca9801720

Observation 33d35ab0-8ac1-4c4d-8c6e-3994e1105e14 · outbound

This paper cites Pruning vs quanti- zation: Which is better? Advances in neural information processing systems, 36:62414–62427, 2023.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Pruning vs quanti- zation: Which is better? Advances in neural information processing systems, 36:62414–62427, 2023

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.239012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.352719Z digest=sha256:55194f59f82eaa44cd4b2f52a6381b4358ef08ababc067a351b5328298e16891

Observation e1665b7b-dcf2-4388-bee8-447535897847 · outbound

This paper cites Efficient memory man- agement for large language model serving with page- dattention.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Efficient memory man- agement for large language model serving with page- dattention

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.220334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.357571Z digest=sha256:9fd62e8f0325bc0f532d67621d87ae0c9c23ed5164bb464a021032aaf5855c9d

Observation 46eac479-8591-4048-99c4-f9ce8f111840 · outbound

This paper cites Bloom: A 176b-parameter open-access multilingual language model.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Bloom: A 176b-parameter open-access multilingual language model

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.202937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.362293Z digest=sha256:e0215334a541ad4dab539e1ba2eee30545be40558b67334caea419642e2e3167

Observation 6f325b37-05c8-47d8-9ace-ba2c8e724dd9 · outbound

This paper cites Losparse: Structured compression of large language models based on low-rank and sparse approximation.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Losparse: Structured compression of large language models based on low-rank and sparse approximation

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.184963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.367211Z digest=sha256:a7f4bffcc132710e8c3ffc734e96b55c012d1ea792a88ef34fda24be99aca178

Observation 2abd438c-11be-4ea1-8af6-a31b7b742fe9 · outbound

This paper cites A method for calculating the deriva- tive of activation functions based on piecewise linear approximation.

Accelerating Large Language Models through Partially Linear Feed-Forward Network A method for calculating the deriva- tive of activation functions based on piecewise linear approximation

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.168198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.372077Z digest=sha256:9f0586d6e32544814d9957b58fb5bef8282a70f1a2f10147461dd18d95c9a0eb

Observation 78b89c51-3c3d-4ab5-97e9-b9f7f859bc78 · outbound

This paper cites Awq: Activation- aware weight quantization for on-device llm compres- sion and acceleration.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Awq: Activation- aware weight quantization for on-device llm compres- sion and acceleration

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.151675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.377928Z digest=sha256:3fc2b156e64a5a7828ee7bb8662aa1cea04bded3d792dbb98222586defe543df

Observation c0b0bb5e-2b4f-4781-8d1a-e1987cdb7b8b · outbound

This paper cites Deja vu: Con- textual sparsity for efficient llms at inference time.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Deja vu: Con- textual sparsity for efficient llms at inference time

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.382810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.382810Z digest=sha256:0436c714f4e1fb3d12ab5e7609d2f54f21923e327866da455bd1322e91c514c6

Observation 2e129649-d204-4878-9880-b13ae5e80f01 · outbound

This paper cites Llm- pruner: On the structural pruning of large language mod- els.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Llm- pruner: On the structural pruning of large language mod- els

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.123371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.387784Z digest=sha256:8c9ab2a70f043817441d5de2ff95c099b238441975e60a5e01b563cadd642166

Observation 18ebb02b-b103-4fac-93df-5ede178bdc9d · outbound

This paper cites The penn treebank: an- notating predicate argument structure.

Accelerating Large Language Models through Partially Linear Feed-Forward Network The penn treebank: an- notating predicate argument structure

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.106322Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.393108Z digest=sha256:484426b0672e5e6c6c374df2148fd5bba24b06309b949e5433981ed303f93eeb

Observation ff2b605b-e130-4127-a010-9f2274bc6588 · outbound

This paper cites Pointer Sentinel Mixture Models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Pointer Sentinel Mixture Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.398462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.398462Z digest=sha256:652f8388738e55f12da43076e1a89634a72b53c6f1c16ed4f183d7ba2357c236

Observation 0d11ea08-45f2-4d27-8897-e34db63e4800 · outbound

This paper cites Relu strikes back: Exploiting activation sparsity in large language models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Relu strikes back: Exploiting activation sparsity in large language models

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.086389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.404970Z digest=sha256:8be3b4e0d104bb3dd4d42da84f11f0f0c3e633dd240eb15b8b01a913c4b0014d

Observation e100caf0-bd02-4053-a847-c090aa904677 · outbound

This paper cites Implementation of a digital neuron with nonlinear activation function using piecewise linear approximation technique.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Implementation of a digital neuron with nonlinear activation function using piecewise linear approximation technique

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.070531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.410416Z digest=sha256:a259719a133ee8352093d26b34fd4f97c1aa6222d8eb2a29ed155ba8ea25cf26

Observation 46d902b8-e5af-4a9b-914c-f5884ea100a3 · outbound

This paper cites On estimation of a probability den- sity function and mode.

Accelerating Large Language Models through Partially Linear Feed-Forward Network On estimation of a probability den- sity function and mode

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.055043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.415544Z digest=sha256:f1f231f2d527e60ecfea13d928d605c8d6136df6291ae59f5652023579c38646

Observation 5f6f5a42-0057-40da-8706-9c5f87352fcc · outbound

This paper cites an unresolved cited work.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Unresolved cited work

Reference 49

Resolution
unresolved
raw_fallback, observed 2026-08-10T19:29:58.039765Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.420620Z digest=sha256:bde7ebd916ba97d5564237669ca7b97c9ec2b848fa48c864b48f77d5be0ecd4f

Observation fc26d064-0da5-4483-9ead-a1bae1cf91bb · outbound

This paper cites Ma- trix compression via randomized low rank and low pre- cision factorization.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Ma- trix compression via randomized low rank and low pre- cision factorization

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:58.023503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.425252Z digest=sha256:2bd52e34328af4c9cacd3e21e7d899c9c39e164f26b04c74948896e0b734ccc7

Observation d986af69-3217-4710-9389-ec1baf7816b8 · outbound

This paper cites Glu variants improve transformer, 2020.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Glu variants improve transformer, 2020

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.430539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.430539Z digest=sha256:521980fb2eabd21db58df477a6ae222ba23621725b3937a16d5b65cf666a334e

Observation 20f0c52a-d450-469e-ab28-166c9950f701 · outbound

This paper cites Powerinfer: Fast large language model serving with a consumer-grade gpu.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Powerinfer: Fast large language model serving with a consumer-grade gpu

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.993947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.435269Z digest=sha256:7a2381c8ed7c1e91fdbc7700e53f7a4dfd0869e78874868ca587bb18ce18f2c8

Observation 71785d44-2d13-4158-8154-fe9dea67d553 · outbound

This paper cites A simple and effective pruning approach for large lan- guage models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network A simple and effective pruning approach for large lan- guage models

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.975790Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.439797Z digest=sha256:008632d0d3b814dc72e018effc79188228f6e86918b3cb696578e2ead5497ccf

Observation 87730f5e-6e14-4f50-8332-7167b5ca0885 · outbound

This paper cites Variable kernel density estimation.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Variable kernel density estimation

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.959140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.444467Z digest=sha256:6360bb2131771a865b396e594aca246551af881be8c64837f0d57cb2ac52cff9

Observation 9e34aa2c-5175-4468-b5a0-c474dde97254 · outbound

This paper cites Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Baby Llama: knowledge distillation from an ensemble of teachers trained on a small dataset with no performance penalty

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.449262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.449262Z digest=sha256:0c1cbf3ad8189825de1eff5c727573979a6e4ca18ab3d625e06166683eec498f

Observation c9cb247a-04b8-46ed-907b-da86dcfe1aac · outbound

This paper cites Norm (mathemat- ics) - wikipedia, 9 2004.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Norm (mathemat- ics) - wikipedia, 9 2004

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.942046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.454472Z digest=sha256:4162363553a5d159cbb28b36f68716e36a5ca4e39465a121581af63fc8f49922

Observation 5d5e99fd-5c1c-4bd4-a127-7de77fb525ce · outbound

This paper cites Llama: Open and efficient foun- dation language models, 2023.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Llama: Open and efficient foun- dation language models, 2023

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.923335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.459332Z digest=sha256:60acb5ade32b11816fab13da2872a70bc02b560dbaf455ba37ded1e0c19fcc6d

Observation b0d9b4fa-f029-4ca5-ba28-14f4c28ee7d3 · outbound

This paper cites Model Compression and Efficient Inference for Large Language Models: A Survey.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Model Compression and Efficient Inference for Large Language Models: A Survey

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.464280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.464280Z digest=sha256:d6a1a9b9a4abf369f561b7a19d08efe8e0f0a440d7e68bf01ed42abb07d03797

Observation c208a281-ae88-4a78-8607-fa24e89187bb · outbound

This paper cites Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.469890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.469890Z digest=sha256:637e5d6d6ae9f9fca4373594f65ec8f7507642093b9ec44f410f383081723a24

Observation 196022ff-cf7d-4578-ba83-6afb1afda3c3 · outbound

This paper cites A Survey of Resource-efficient LLM and Multimodal Foundation Models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network A Survey of Resource-efficient LLM and Multimodal Foundation Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.474897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.474897Z digest=sha256:89c946805067be97ff807e84221a119c942b6eb63dfda62b23e4b58691d7bf14

Observation d809c6b8-c51d-4e3d-a727-71dfc47701ed · outbound

This paper cites Qwen2.5 Technical Report.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Qwen2.5 Technical Report

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.479865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.479865Z digest=sha256:fb5af88d7dbe0fec30f1bd07b479f8cbdd84902ec75472420dc2173f78ad0751

Observation c1f05672-b123-4df4-a139-3846fb852591 · outbound

This paper cites Llmcbench: Benchmarking large language model compression for efficient deployment.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Llmcbench: Benchmarking large language model compression for efficient deployment

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.905501Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.484935Z digest=sha256:d033fe6cd5fbd042f5bf4b73867c56802974f2125a4c4de6401ebb518bbce64f

Observation 880d2a4f-b811-4098-81fe-7d2af96ea0c1 · outbound

This paper cites Zeroquant: Efficient and affordable post-training quantization for large-scale transformers.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Zeroquant: Efficient and affordable post-training quantization for large-scale transformers

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.490516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.490516Z digest=sha256:a8f11009fba1cf66cffba732931c3f74f6b2d2542cff861c86dfd155ff15768f

Observation b61e8c3d-98b9-45e5-b58f-7bab992c0e90 · outbound

This paper cites Outlier weighed layerwise sparsity (OWL): A missing secret sauce for pruning LLMs to high sparsity.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Outlier weighed layerwise sparsity (OWL): A missing secret sauce for pruning LLMs to high sparsity

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.877191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.495499Z digest=sha256:7ac3a387a38f5980cb424864ec5e8117b39335ba3414734f4a5089b996d10afe

Observation a7f3fe86-1afd-43a3-9585-2e055337003d · outbound

This paper cites ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization.

Accelerating Large Language Models through Partially Linear Feed-Forward Network ShiftAddLLM: Accelerating Pretrained LLMs via Post-Training Multiplication-Less Reparameterization

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.500991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.500991Z digest=sha256:30e0719d2d4a90711b68e95b500380b33eb1421ad4b3e6c1852ef9bfc8b9b969

Observation ae8c5ab6-16aa-4c53-8d15-ab52856f56d3 · outbound

This paper cites A novel sigmoid function approx- imation suitable for neural networks on fpga.

Accelerating Large Language Models through Partially Linear Feed-Forward Network A novel sigmoid function approx- imation suitable for neural networks on fpga

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.858841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.506575Z digest=sha256:a273466055bc0b46a07e2d82f820da9b4da5f9773c80143d6b6a5f8e3cb9fe6e

Observation e6207a2a-4e7b-49e9-a5c3-422b04599a81 · outbound

This paper cites Inves- tigating layer importance in large language models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Inves- tigating layer importance in large language models

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.841083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.512331Z digest=sha256:b41797156512c3ad9988c2071b8bfc7fa374b5a6435fe965bfe5ad7b8ae24a3f

Observation c3fd90f2-2ebd-4c22-aec3-8dbf4e0f84e1 · outbound

This paper cites Plug-and-play: An efficient post-training pruning method for large lan- guage models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Plug-and-play: An efficient post-training pruning method for large lan- guage models

Reference 68

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T19:29:57.823674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.517543Z digest=sha256:39bad1a8d4a7af4c8cebf9447eafb31e80690fa723d8aee98eef44ce07519af0

Observation 16628c73-4829-48be-bc05-9294ae5df128 · outbound

This paper cites A Survey on Efficient Inference for Large Language Models.

Accelerating Large Language Models through Partially Linear Feed-Forward Network A Survey on Efficient Inference for Large Language Models

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-10T19:29:57.522816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T19:29:57.522816Z digest=sha256:ce9da28fab5fdf89d0b0f2808108ea37cfa23456c5cf843d5780f99de8bb1962

Observation 0f360ec6-00c8-4083-9147-66736c8aa1f8 · outbound

This paper cites an unresolved cited work.

Accelerating Large Language Models through Partially Linear Feed-Forward Network Unresolved cited work

Reference 2023

Resolution
unresolved
raw_fallback, observed 2026-08-10T19:29:58.514100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T19:29:57.231369Z digest=sha256:fe51c4d71ba2fabc18d1843bf81ba856aaa95ccb328cf1e43e9b6f5bfeae8439

Pith citing papers

No inbound Pith citation observations are available.