Pith. sign in

Paper Citation Record · LEDGER

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models

As of 20 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2504.12526.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.12526 v1

Coverage vector

measured 27 of 27 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:37:04.085148Z

measured 27 of 27 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

27 of 27 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved26
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b70a65be-caa0-4bb3-b59c-291bb1c85459 · outbound

This paper cites GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:03.988247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:03.988247Z digest=sha256:b902ec3a993fbc4b5807f828537619a981438ab5c9c8166fb5fdba28fe65be98

Observation fa6949e7-5842-4636-ac8f-41535f3bb3de · outbound

This paper cites Qwen Technical Report.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Qwen Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:03.992561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:03.992561Z digest=sha256:8a07c619d4406549f4299d52a7d52699ec4bb4b918c1b20727890e82c14a3888

Observation 31f4d700-c7d4-4df3-ad0c-bec071bdc39a · outbound

This paper cites Longformer: The Long-Document Transformer.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Longformer: The Long-Document Transformer

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:03.996360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:03.996360Z digest=sha256:ab088a9370731a4c5fc740fb992d4494a87d14aabeb6aa6e787a30ed6d2efedc

Observation 8681f33d-23d5-41f8-bbef-d8f61945dffc · outbound

This paper cites Language models are few-shot learners.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Language models are few-shot learners

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.003900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.003900Z digest=sha256:85282d3edd4286611f6c731c28b740bc5b00785479b69f30f96a79ef194870dd

Observation d79c5867-c0c3-46bd-a45f-303d2b5cc021 · outbound

This paper cites Training Deep Nets with Sublinear Memory Cost.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Training Deep Nets with Sublinear Memory Cost

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.007481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.007481Z digest=sha256:1958260923d8d997c10a2d3fb1f2715852587d9d861acf449b27a20cd39216ff

Observation 30c09d60-b4cd-4590-b376-b88b837cebdf · outbound

This paper cites Gaussian Error Linear Units (GELUs).

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Gaussian Error Linear Units (GELUs)

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.018509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.018509Z digest=sha256:853d3fe77add7142d8d9295a94bd37046363652c601a88674a654d3ce8fc9add

Observation 937d8f17-05b4-4a40-bb8b-89c176168bc0 · outbound

This paper cites Mistral 7B.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Mistral 7B

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.025925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.025925Z digest=sha256:901d5e7e86c5b83a023177c22aa567434b0f628f88cd9ef0182042d1c30fe9d4

Observation 1f4ddbd4-941d-45d2-9e05-cdd1e23d34f1 · outbound

This paper cites Reformer: The Efficient Transformer.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Reformer: The Efficient Transformer

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.029176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.029176Z digest=sha256:afeb7392362a73bcbd8fea564766d981afbfcf631690fdbe6cc2ca989a6adb61

Observation 5edd78aa-6606-4dbe-b703-8c4264f82efe · outbound

This paper cites Efficient Memory Management for Large Language Model Serving with PagedAttention.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Efficient Memory Management for Large Language Model Serving with PagedAttention

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.033106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.033106Z digest=sha256:4b6b0b86c766cae6d97e707ba25d4dbc3c6a0c359555c4373401c0e14d0b8619

Observation 791d11af-e209-41c9-ab6f-5e3dd20a6002 · outbound

This paper cites an unresolved cited work.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-16T12:37:04.407195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T12:37:04.040394Z digest=sha256:ad5ca6e31d15f344cc9d9fa433f909bcb0b9d773686d04c7540c263a0ac7e9e5

Observation cc669be0-b05f-4031-9f2a-697391eca331 · outbound

This paper cites Searching for Activation Functions.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Searching for Activation Functions

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.050659Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.050659Z digest=sha256:9e3fa6b4389cc221efb1b229dcf54ab4dd7a8576cbbbedb3e8cae9ccbb3e6166

Observation ef5976cd-401f-429c-bfe3-41c2a001659b · outbound

This paper cites Morgane Riviere, Shreya Pathak, Pier Giuseppe Sessa, Cassidy Hardin, Surya Bhupatiraju, L´eonard Hussenot, Thomas Mesnard, Bobak Shahriari, Alexandre Ram´e, Johan Ferret, et al.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Morgane Riviere, Shreya Pathak, Pier Giuseppe Sessa, Cassidy Hardin, Surya Bhupatiraju, L´eonard Hussenot, Thomas Mesnard, Bobak Shahriari, Alexandre Ram´e, Johan Ferret, et al

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.054919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.054919Z digest=sha256:1d1f28efbce3498a78bf76781dfabfe2a28742990f3cfa2df91991846084ab73

Observation 506542d0-83bf-4bd0-ade7-dd566ec2f791 · outbound

This paper cites Fast Transformer Decoding: One Write-Head is All You Need.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Fast Transformer Decoding: One Write-Head is All You Need

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.058048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.058048Z digest=sha256:e1a61cbb47e3c0fc32052e354855806b431af1f2b0e18f2ed736001435973be0

Observation b44b3e81-c2b0-4f14-92fc-06759c5f9257 · outbound

This paper cites Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.064915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.064915Z digest=sha256:6ce20191323159c0411a214c3fa2cbc72ff7e192b573a09b6318ee17d7863214

Observation 27aacc16-2829-4e1e-add6-8492ae44fff9 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.068507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.068507Z digest=sha256:e197812ef44660f46548da3f1c56fe26fe571cb9bf37e3b026c99f627d1a6e02

Observation a2d4a028-50d7-462e-80ca-527980c6313a · outbound

This paper cites Long Range Arena: A Benchmark for Efficient Transformers.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Long Range Arena: A Benchmark for Efficient Transformers

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.071767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.071767Z digest=sha256:79a13252f071660affc1193e798be6c7017288df7c7c9a536f39e76c0f6182d7

Observation d5e8d15e-c0ae-4b61-ab3b-2860aed233cd · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.075179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.075179Z digest=sha256:b995ff913b6499d854dd333b99234c6f36598c214e045ddbef705c8f3800761a

Observation ba2c33e5-8ccb-482f-acaa-be2949a91614 · outbound

This paper cites Large Batch Optimization for Deep Learning: Training BERT in 76 minutes.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Large Batch Optimization for Deep Learning: Training BERT in 76 minutes

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.081633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.081633Z digest=sha256:1f05af30ab83ddc6400bedeb6d7182d1fcd0d12d76d33a02511cdb03ec0f2282

Observation ae10ed15-d64d-4be1-a0c2-6458c89b49d0 · outbound

This paper cites memory trade-off and comparing them with other optimization methods.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models memory trade-off and comparing them with other optimization methods

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T12:37:04.396971Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-16T12:37:04.085148Z digest=sha256:334500c8969a06988ab3607cb0cbf2fa2383a06ac11301ee3e4fb9690132f17f

Observation ca4520ef-3c55-4e33-a5a8-b43c43f49046 · outbound

This paper cites FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.011426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.011426Z digest=sha256:ce22dbdc1a8f0934e203e837246fb4a8811ab3eb601eb2778f336c4c0ed2086c

Observation 2f060934-ee4f-4f57-961a-63c084e61d25 · outbound

This paper cites Linformer: Self-Attention with Linear Complexity.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Linformer: Self-Attention with Linear Complexity

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.078418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.078418Z digest=sha256:aba7686c4116eb36d59285d38b72166e9ede0f69c1795566c9894971c3e75ef1

Observation 28264a83-f247-4924-bce6-06ced3814f1f · outbound

This paper cites GLU Variants Improve Transformer.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models GLU Variants Improve Transformer

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.061666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.061666Z digest=sha256:3fbf9f41e49612acdd613baffa4db7c33679a77cb030cde037d83c3f7f73d34f

Observation fd908b79-eb89-499d-a733-b4dd6ed87520 · outbound

This paper cites Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:03.999936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:03.999936Z digest=sha256:08d8f84b0448abb956e138dc52392df2ea7ee2bfdc467d4feded37fb600e6bb9

Observation 778f4d91-b6fd-4c0a-8ccd-82a4b4287482 · outbound

This paper cites Self-attention Does Not Need $O(n^2)$ Memory.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Self-attention Does Not Need $O(n^2)$ Memory

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.047412Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.047412Z digest=sha256:3f0b428638f113760adbc0c7e009ddc4e5f1658cbb9e1fa4e25c61f3332ecc7e

Observation dcd9a9c8-1f30-4078-8947-a73970720cf9 · outbound

This paper cites The Llama 3 Herd of Models.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models The Llama 3 Herd of Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.014973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.014973Z digest=sha256:630db41ebfdbbf70bfd434df8b43e7d1b4db2a004751bfb467d781caf8756c3b

Observation 18839c6e-1293-4833-a060-f1e522083534 · outbound

This paper cites SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:03.984847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:03.984847Z digest=sha256:d2ccc56d8a5aa38960902910f8893e35b386f85ee7ea5ccf853d6067a4ace82b

Observation 6443fef6-db0f-4bf6-bb6f-ff150fa05b4e · outbound

This paper cites HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading.

MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-16T12:37:04.036729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:37:04.036729Z digest=sha256:0ff1b36136ae2014ff4e8c632cc9bdbfaa29e454c1ed74d252658e6e4f5ebd2b

Pith citing papers

No inbound Pith citation observations are available.