Pith. sign in

Paper Citation Record · LEDGER

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference

As of 17 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2505.08620.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.08620 v1

Coverage vector

measured 77 of 77 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:55:07.904113Z

measured 77 of 77 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

77 of 77 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved74
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch2

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f69522c5-a6ee-43d5-a9a1-09703cf97739 · outbound

This paper cites URL: " 'urlintro :=.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference URL: " 'urlintro :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.541700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.541700Z digest=sha256:4408b49d742a3b70db57d06c82b141cb609460cc0927c47babbd5f1e4c21b18f

Observation b67e10b3-03eb-47d7-b597-d237c942fcbe · outbound

This paper cites write newline.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.590040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.590040Z digest=sha256:cb61688951abad4eecc4e747851c8be57c04390c18acc73ccf26255832e414c1

Observation b2f02cb7-83f1-4776-a5a3-19333a2e918e · outbound

This paper cites Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.594196Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.594196Z digest=sha256:c5df7efcf85cc78d4d737516ad5f1a16f987008f0a2c95ad26147087261971c1

Observation b044020c-f4e1-4f5b-acae-1e4b273b55ca · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.598101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.598101Z digest=sha256:aa1c7c666f0dbd9e113bd23313fdf56ae7582d68bbcb2aedb98dd31fabb73c4b

Observation a019d1c3-53cb-437e-b95b-39da7b8f67a9 · outbound

This paper cites Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Beyond Efficiency: A Systematic Survey of Resource-Efficient Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.601565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.601565Z digest=sha256:0e684053a157c22ae32867eabb334e2693c63ac8194fcf7d35a9b8e2185b22a4

Observation 390bab73-f08d-41e8-8a53-0050a6a1e801 · outbound

This paper cites Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.605534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.605534Z digest=sha256:533e52e68e38f4322497e6c84c91b8a3d39e1ee829238457d4700a7753967548

Observation c448fa03-738e-4332-b0ff-a203d72bc99f · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.610913Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.610913Z digest=sha256:5ef9fedf8caa4837f89c81cb87f4c641bcd5ad624749c203f0bd0e38d373d135

Observation b612e36d-a5c9-4395-b7d3-b36f369f8b7e · outbound

This paper cites Understanding and Overcoming the Challenges of Efficient Transformer Quantization.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Understanding and Overcoming the Challenges of Efficient Transformer Quantization

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.616176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.616176Z digest=sha256:7c86b626e9e647092ade97d0ac439ceeb92796d7f31b4f8a6d07f5775b422173

Observation 241426de-e55b-4c35-ac6e-f4c579804349 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.621631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.621631Z digest=sha256:0fc77079af52acf1477effda664392fea693153a705d8a03612ad695aa615f0f

Observation ed282d8c-f2bb-4639-a96f-a74561dd6492 · outbound

This paper cites DB-LLM: Accurate Dual-Binarization for Efficient LLMs.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference DB-LLM: Accurate Dual-Binarization for Efficient LLMs

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.626900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.626900Z digest=sha256:abda56f3989a14bb405d3d9be746b17b10b80309bdaa29b1b508216557268680

Observation e1032a04-a56d-4a91-8e36-13829a648ead · outbound

This paper cites Exploring Quantization for Efficient Pre-Training of Transformer Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Exploring Quantization for Efficient Pre-Training of Transformer Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.632223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.632223Z digest=sha256:5305d20b5afafd338eecfcf9a26e6c9ef16f9e6756fb7d7687cd4920deb59760

Observation 9afc2dce-7266-4d10-a6c4-0d7f140e64d3 · outbound

This paper cites Training deep neural networks with low precision multiplications.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Training deep neural networks with low precision multiplications

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.637039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.637039Z digest=sha256:015f4455effa2e55e33a95441fa7e8560325da63d1c05b19c3ab7b65d0e54ea8

Observation 2b9f9111-fc94-4566-a901-0eef4b546c9a · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.089251Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.641619Z digest=sha256:d5dbf666950b7f71e131194fed607e17c86f769229bcc7f9150e4f88a041551c

Observation 317cd469-d397-4b2f-a865-7a915706a715 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 14

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.075712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.645509Z digest=sha256:7982355d783e58838641d21d47230cf2b4dda2292f0fd55eafdd46cce17764e8

Observation 72338d91-ff4f-4743-a570-8e04237cdb1c · outbound

This paper cites Extreme Compression of Large Language Models via Additive Quantization.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Extreme Compression of Large Language Models via Additive Quantization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.649449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.649449Z digest=sha256:71ceb624e3ae54474cf59804ebcb4c203343c62a1e2f12b2486a92d308bf50dd

Observation e481b8b8-95d1-49e2-94c4-40643a0cb9a8 · outbound

This paper cites Training with Quantization Noise for Extreme Model Compression.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Training with Quantization Noise for Extreme Model Compression

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.653191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.653191Z digest=sha256:6a1fb5c60c0a788a8ce02e7307badd83b92d09975ad9a9de10e85949a8da6f8b

Observation 9995e763-ac56-4686-a063-0205d52a322e · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 17

Resolution
metadata mismatch
raw_fallback, observed 2026-08-15T21:55:08.830986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.657822Z digest=sha256:5e2a9933901a528ef902098337d6f8f781aa3c687836e1e2c87ddf77326f13bf

Observation ee1dbec1-dc4e-460a-9dbd-cd5d45772b9b · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.661224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.661224Z digest=sha256:d40555204ea1268ffed4bcd3f268af31f8b5560896aa1ab8f022f9e3ed0a773a

Observation 73c1d871-38e5-4d10-aba5-a23e6bff121e · outbound

This paper cites Geman and G.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Geman and G

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.664762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.664762Z digest=sha256:a1625cff79df0eaa8bc7e0e5719597715f8fade609873c12a999de7e28d8ddc7

Observation 539cfbdb-cf9a-4669-81d2-011086da64dd · outbound

This paper cites Gemma 2: Improving Open Language Models at a Practical Size.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Gemma 2: Improving Open Language Models at a Practical Size

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.668750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.668750Z digest=sha256:d4d9bfddc46cb43d7d7d200916709c7f412f49e7364fa80d754e65e17b2b67f6

Observation cf0a92c0-193d-4bd1-8410-948fb423db71 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.063610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.673703Z digest=sha256:fd64801df42f2ba5d78f9c2c9f40e2ffdd970a67b16ed36bbe1716df6f3d5b64

Observation 2b255e50-2ccd-4644-b7e1-772928d9ca39 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.049817Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.677674Z digest=sha256:071b359abdd7133eb2a26183f5ca9893e2fb27b66ff88dc7f6e22f253ffb67ab

Observation bee96acd-57cb-44b9-bc1d-723ba9b8e24d · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.681801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.681801Z digest=sha256:ad07e160e656da9d51599abc18b84b8cffc9046dfb1be17d662565d18371cd27

Observation 5cf4727b-b398-4cd7-88de-8f469956f3cf · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.687546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.687546Z digest=sha256:e93b71b1684ab853bcef7c1a8e66cc95522ac0f5883eb28c4e774992a22ea86d

Observation 2492e1ea-9beb-4a3c-b2f4-52aa7ac82601 · outbound

This paper cites The Llama 3 Herd of Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference The Llama 3 Herd of Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.692906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.692906Z digest=sha256:b001b5b364dd66e3d7634fad30a33861c4538ca146288ef4e8cbf44ea289123a

Observation 3c14984f-ced2-4bee-9d0a-e222d17ffae7 · outbound

This paper cites OLMo: Accelerating the Science of Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference OLMo: Accelerating the Science of Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.696724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.696724Z digest=sha256:77e1f434b7bb59a7ccf5a89b91830f21528070b0b74b2980eaeca8c2ef67ab2a

Observation 6628a72e-73b2-43af-b950-afb68f0b51f6 · outbound

This paper cites Mamba: Linear-Time Sequence Modeling with Selective State Spaces.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.701737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.701737Z digest=sha256:50bf6b4a290fce7a62c71097292c05dde1c9bad4f03557a4c2cf92e68260b328

Observation 56ef0392-1fcc-4b5c-b08e-647a2b76e74b · outbound

This paper cites Efficiently Modeling Long Sequences with Structured State Spaces.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Efficiently Modeling Long Sequences with Structured State Spaces

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.706408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.706408Z digest=sha256:a92517b5e1f97d04447f67282daab835dcc5fa55d11f9c2ccb1907dd3f6c3bf7

Observation c75d3048-5815-4775-b017-ed02bbb6d2fb · outbound

This paper cites Textbooks Are All You Need.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Textbooks Are All You Need

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.710554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.710554Z digest=sha256:ea4e6c621e91d3f9ade27704b3438e5fb46cbca53e7b3f5fbea655731c96340f

Observation ddbd6b45-3fa2-45a3-8dd1-d4e5c61d9605 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.030593Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.714634Z digest=sha256:93207e0c64370828f7dc3dca558768d4e651535ef94da15fffd5a24f10001f14

Observation 13505d0a-3213-4536-a225-9a1d7d10215f · outbound

This paper cites Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Deep Compression: Compressing Deep Neural Networks with Pruning, Trained Quantization and Huffman Coding

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.718146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.718146Z digest=sha256:de670b227716c94af89c5593c7864ef4d02de94d6c9280e3c1f6e7d8f74bedac

Observation 31b67e2d-1fec-48bd-a0b9-410f2b5a01c3 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.020190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.722456Z digest=sha256:eb37c40eb37d6a151895a739ed37c2405424510f730e3ca180ba67cf8e351a00

Observation 72520311-25a9-4c86-82e3-a70da4991417 · outbound

This paper cites Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Delving Deep into Rectifiers: Surpassing Human-Level Performance on ImageNet Classification

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.726237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.726237Z digest=sha256:e6a9b022fc595498e35a44e742d3fe785676e5bb3b392e1f602c84430dbd9da0

Observation 6b512627-f919-4499-bffc-84527ac9d3e2 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:09.009050Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.729384Z digest=sha256:5168fa7697e7ff6ba0272086df775643459133fe7d72bcba16c78d4faedde682

Observation 31b60467-2f1c-48dc-8bba-b80e586c3443 · outbound

This paper cites BiLLM: Pushing the Limit of Post-Training Quantization for LLMs.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference BiLLM: Pushing the Limit of Post-Training Quantization for LLMs

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.732645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.732645Z digest=sha256:053d2a38f1b9fe4e7817fdffa09ba43a1bd0322e8e0f9a5e1b79cbb56e1a1a93

Observation 3e5637d4-01c8-4b55-8dd3-a4921b77e2d9 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:08.995645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.736342Z digest=sha256:e91968903fab7ab58c67f49ef05b975ab5f2db4245d941500026fbbb86885c73

Observation a2e26410-c174-4e2f-9a8f-48983be6e020 · outbound

This paper cites Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.740239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.740239Z digest=sha256:f0fd139b88207ed87da05b37a74a67af86c20098fca6d91c4bc2110f94038791

Observation 0581e8b3-7625-4085-869d-d0bbda431e7c · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.744183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.744183Z digest=sha256:94956d505be5e79dd9d92bd364c0bf021733b0ffbdd79910e34554016c021cd3

Observation 8030413c-c3af-4266-b404-9671b20a4ef9 · outbound

This paper cites Mistral 7B.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Mistral 7B

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.747879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.747879Z digest=sha256:2ee015332c3f4da7bff50292cc25d4b94d71553b623b1cbd74c793b2150a32d8

Observation 91623583-dc4e-47ec-b501-ead0a05400bf · outbound

This paper cites A Comprehensive Evaluation of Quantization Strategies for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Comprehensive Evaluation of Quantization Strategies for Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.751298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.751298Z digest=sha256:4d700a926ce03e3b0adfb2572c2de92a421438cc7cc0d69ce3d634c3ef3d43c8

Observation 84fc88d0-9a2a-44a7-98c2-51c5908f518c · outbound

This paper cites Scaling Laws for Neural Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Scaling Laws for Neural Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.755352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.755352Z digest=sha256:0961d287e584fd33f0c1195b8bbfbe48f5206fb2e246f585bdb14f1b87f7d326

Observation a22e979f-9033-4976-88f9-88dd4860720f · outbound

This paper cites BERT Busters: Outlier Dimensions that Disrupt Transformers.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference BERT Busters: Outlier Dimensions that Disrupt Transformers

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.759006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.759006Z digest=sha256:fad1216bd73f0b398733e421a275c40c54ef5dab62b144873066d1c430c4f4ec

Observation abd97295-052b-48ee-a1d6-9311a89c0d33 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.763703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.763703Z digest=sha256:a9d7ee2a6bf8652373c0030d0c6aa14d05491b596d8cefec43aedc414d416924

Observation c88b5e1e-c90d-4b8c-8475-92eaa9dec5a1 · outbound

This paper cites Continuous Approximations for Improving Quantization Aware Training of LLMs.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Continuous Approximations for Improving Quantization Aware Training of LLMs

Reference 44

Resolution
verified exact
local_arxiv, observed 2026-08-15T21:55:08.482844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.770818Z digest=sha256:cf22835b00f0a01516d6f93297f5a32ecd2882e6bf5a765163f2a85fda809d2c

Observation 1c95a6d2-a684-4f1b-aef2-4a70c054fa29 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:08.968173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.774992Z digest=sha256:c4af13107899ca4361b85a781a854c3bdc557f88349c6183016c42c087ab9fb1

Observation 4f4fbe98-243a-4f87-99c3-d3d6773e5afe · outbound

This paper cites AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.778009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.778009Z digest=sha256:f14b517c717bfe4a4d487c31cc73b3ab318d10ad40f6fd330b246dfda3d544c3

Observation 62f8c64e-cd0c-44b1-a2b5-888e4359c5a2 · outbound

This paper cites QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.782932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.782932Z digest=sha256:d39f6f47ac8dd19635d598a8cc57f25425a0ce280b4f34fa183598d232257b45

Observation 7236cffe-940f-406e-ad5c-63f2ecc2844d · outbound

This paper cites DeepSeek-V3 Technical Report.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference DeepSeek-V3 Technical Report

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.787163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.787163Z digest=sha256:4d85e460e4e23de2825061640c371b9da22bde1bcfcd715409b5a2cc82c436be

Observation c9d94162-12e3-4817-ba77-2e12764f43ec · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.791113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.791113Z digest=sha256:6bf919317505929187ce958fe330936a707e8b6e906dff0d67ff90f476a9d89b

Observation 5ba550af-65c3-4b9f-aab6-7ef3e791b268 · outbound

This paper cites The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.794971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.794971Z digest=sha256:92aed708a4fb286bcffdfffc4ab87651861c6fc4a75a4857c4b983e9ee642345

Observation 683e553e-1eea-4b30-a8e2-392558263909 · outbound

This paper cites FP8 Formats for Deep Learning.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference FP8 Formats for Deep Learning

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.798384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.798384Z digest=sha256:44aab69663cfc5c35311b398f43b3fcbb5773a366b8b5ebb9ce04f35bcc6ae4f

Observation 2ae36f70-9e16-48f6-a26d-3f7e5633bdec · outbound

This paper cites A White Paper on Neural Network Quantization.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A White Paper on Neural Network Quantization

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.802619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.802619Z digest=sha256:f2ef42e8ced7aaa6ab83e4d1d09cf95f0772bc62e17c2a7335bc5432a209f06f

Observation ebf99f63-2438-4240-a0f0-29eddb7c528b · outbound

This paper cites 2 OLMo 2 Furious.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference 2 OLMo 2 Furious

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.808536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.808536Z digest=sha256:d9d5fe2a1ab295ada5386402d169b40650b051a4c8447d40b4ae3a92d6ce3ffd

Observation 64b743a7-f7db-4c10-88b1-798fc318679e · outbound

This paper cites RWKV: Reinventing RNNs for the Transformer Era.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference RWKV: Reinventing RNNs for the Transformer Era

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.812705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.812705Z digest=sha256:605f5a578d6d9d8ffbbaca5de1aedad58c0e1070243cd12c47ffff56573caa36

Observation fe5b0c0e-2db7-4bbd-8de5-f6fc9c49b100 · outbound

This paper cites FP8-LM: Training FP8 Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference FP8-LM: Training FP8 Large Language Models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.817270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.817270Z digest=sha256:420cd75aaf8f38bdac1f74af5eda10e05f5aaeac0f43faaeb73ecebb4187b49f

Observation 9afee1ad-9f2f-47ff-bcb8-4c22d24e1c22 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.821797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.821797Z digest=sha256:34de8a2b877e65fa1c4007a6a78d0cee3b47a71fead5e27fdd0bbd00cf619ebf

Observation 2c7a0049-4f22-4e93-bf9c-61ee84c54c6e · outbound

This paper cites PB-LLM: Partially Binarized Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference PB-LLM: Partially Binarized Large Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.826096Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.826096Z digest=sha256:654f42c2fcbcd67f5e776e276217e7c598c2506b13465fe4fc6d11bb4016f483

Observation ddeb10b5-e3e7-4d32-97f1-1b75c32f4ca7 · outbound

This paper cites Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.829791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.829791Z digest=sha256:aee075f60775abf6f442a81fa5513d40aabf507fae844f3036f5c5415f24ade9

Observation 7ec3369c-b2ad-43fd-b81a-0d9204c7ad44 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 59

Resolution
metadata mismatch
raw_fallback, observed 2026-08-15T21:55:08.294400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.835328Z digest=sha256:854c867e18da78eb72a60770e01bcce99d828bdca95de932e7cce116859ec140

Observation df39d202-0046-41ee-887b-6abd5c9aa80d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference LLaMA: Open and Efficient Foundation Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.839653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.839653Z digest=sha256:251a068a56e0d9bfc28ffba527ec66d244b36694ae4b63cb1c0fa7f9f6c15fc9

Observation 3fff1632-0f20-4d0a-b451-838739deef44 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.843300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.843300Z digest=sha256:9e34fe2fac1cb48a1d1f00e5de9823e330e5f8dfc73d36927da66970eb31a50b

Observation 40a72d16-bfc1-49c1-a365-f495bba7c8a8 · outbound

This paper cites FP8 versus INT8 for efficient deep learning inference.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference FP8 versus INT8 for efficient deep learning inference

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.846294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.846294Z digest=sha256:6d22558e254b126cd5e1b1cf16fbb050d59763324165a0fa610168e593282f42

Observation c743b5c6-75ca-4705-b5a7-269323e77e4d · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.849606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.849606Z digest=sha256:9d10246c0762a7f8d859dcc751c2f2adb6ed4c5887359f567180b26ae5e7ec49

Observation fb280529-c917-4e18-9ceb-8f41d2044b19 · outbound

This paper cites A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.852727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.852727Z digest=sha256:796566ac35bc60bf0593b3e4b22ba071465e2e5d6f0ee63bfd5add9cf4b2c68d

Observation a21cfa1a-5be7-4884-ba60-aff6a251ca15 · outbound

This paper cites BitNet: Scaling 1-bit Transformers for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference BitNet: Scaling 1-bit Transformers for Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.856402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.856402Z digest=sha256:9be4eab29fb958b8599f437e69aaec1e3d0d317cb10631251bc0c55c5f31eff7

Observation 402abf5c-5084-427c-a65a-d9f20c138853 · outbound

This paper cites Emergent Abilities of Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Emergent Abilities of Large Language Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.859962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.859962Z digest=sha256:06d3b9d11decd3b9e0d3846bc00681cee845e979c92ca6f54bb2380c57125a53

Observation 31570def-bd1d-4203-a5d6-ef675b01d94d · outbound

This paper cites Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Outlier Suppression+: Accurate quantization of large language models by equivalent and optimal shifting and scaling

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.863414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.863414Z digest=sha256:84eb6fdfc4a333f4b9deeee5afedcc573a37f2d3e1c2b8e0a00ce26effd463ad

Observation 54b24241-8fda-405e-8762-3237e277b414 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 68

Resolution
unresolved
raw_fallback, observed 2026-08-15T21:55:08.940754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T21:55:07.866313Z digest=sha256:a89e148695f2e5876dddc13d928005200efdf53cccb4a596f3f2bb0db51f916f

Observation f23f9d0f-c4b7-4dc2-b8ac-ddcaf324ea13 · outbound

This paper cites HuggingFace's Transformers: State-of-the-art Natural Language Processing.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference HuggingFace's Transformers: State-of-the-art Natural Language Processing

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.869841Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.869841Z digest=sha256:39c0edf5a8bc490dc709e9a8b34ad915f7dbfd9710983d4ce5840f393eabd674

Observation 0952677b-5ac0-45bf-bdc4-34e0726f8c96 · outbound

This paper cites SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.873536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.873536Z digest=sha256:1bc9059a637c5208c3c5a92104ea5274398ba69a0ea775b91a1d2afb4a31b0b6

Observation 45ec0f7b-73cb-4e47-bc37-5d2b3f5d44d3 · outbound

This paper cites ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.877611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.877611Z digest=sha256:0b814db0b1bedcadd8c83d4bbc94d8fd4ee5dc93aa8ed93f737d24303404df76

Observation 95b31ac0-1b8e-471c-a3b7-6cd45ee75356 · outbound

This paper cites ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference ZeroQuant-V2: Exploring Post-training Quantization in LLMs from Comprehensive Study to Low Rank Compensation

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.881424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.881424Z digest=sha256:dc1c3d0a6d856b56ecb4f8d2565afe4a8a0f85d0bc6a1a85d8f64b5334af34e8

Observation fb9275a2-7580-49fe-a2fa-754f1f608c9b · outbound

This paper cites Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.886040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.886040Z digest=sha256:6a099edc0ec7bbd9fb766da8a1551c624f4cc6b3ef0b681b238a5bc591787f8a

Observation 5f74d1cf-aad8-4c85-9702-28eb2d240c09 · outbound

This paper cites an unresolved cited work.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference Unresolved cited work

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.890297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.890297Z digest=sha256:037ea6e05a075b973042bebdf70801bbb78445bd99e1b3d84357f2870e3fe442

Observation 988529cf-de0d-4dc4-b941-e1875361a074 · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference OPT: Open Pre-trained Transformer Language Models

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.894631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.894631Z digest=sha256:7a2f4408c16cac26397b57faa4dd2f7d67833f61f348732f492d0ca91281d408

Observation 1c61e00b-4e12-4b9c-ae6b-80370319db2e · outbound

This paper cites A Survey on Efficient Inference for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Survey on Efficient Inference for Large Language Models

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.900011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.900011Z digest=sha256:d96dcb39d51f1ff6e0625b6f9b168e6dbdb07c97d40552cac73f81a7a8504dc0

Observation 5f175c5c-0b68-40bc-82a2-495a124fb0cb · outbound

This paper cites A Survey on Model Compression for Large Language Models.

Resource-Efficient Language Models: Quantization for Fast and Accessible Inference A Survey on Model Compression for Large Language Models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T21:55:07.904113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:55:07.904113Z digest=sha256:e2468abde3a2805afc902688eb7c6f772bfa7852cd612089b4123e966f0d04d1

Pith citing papers

No inbound Pith citation observations are available.