Pith. sign in

Paper Citation Record · LEDGER

Supernova: Achieving More with Less in Transformer Architectures

As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.15773.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.15773 v2

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:29:54.867626Z

measured 22 of 22 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 873e7234-a520-4a73-b01c-7b87849f185a · outbound

This paper cites Attention is all you need.Advances in neural information processing systems, 30, 2017.

Supernova: Achieving More with Less in Transformer Architectures Attention is all you need.Advances in neural information processing systems, 30, 2017

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.759976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.759976Z digest=sha256:c4fa91fef46433d332fca893c75dc20ee60be5685250d0dfefc9492fd097a79f

Observation 91e15f32-f3eb-482a-bfb4-baa52963afdf · outbound

This paper cites Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019.

Supernova: Achieving More with Less in Transformer Architectures Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.764915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.764915Z digest=sha256:44d6a2c0127416ea5c1c3a5fcb6a443f666ca126c2c929db5c0d6c045a1c1e23

Observation 134bb493-ef2b-4749-9a81-67f508589e2a · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Supernova: Achieving More with Less in Transformer Architectures BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.769768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.769768Z digest=sha256:a468e48d1bd91bbf4900718cfcdd3211d81a7eeb8eb9ef8dd5a827a97ca51411

Observation 035b3f49-bd53-4177-9e9f-d631df31a567 · outbound

This paper cites RoFormer: Enhanced Transformer with Rotary Position Embedding.

Supernova: Achieving More with Less in Transformer Architectures RoFormer: Enhanced Transformer with Rotary Position Embedding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.775014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.775014Z digest=sha256:0e945e8583041a7958f5b86ee595f48354d093853d0ce181a59c13aad1520b66

Observation 81d75129-1e8e-43d0-aa96-c1c6ad580f70 · outbound

This paper cites GPT-NeoX-20B: An Open-Source Autoregressive Language Model.

Supernova: Achieving More with Less in Transformer Architectures GPT-NeoX-20B: An Open-Source Autoregressive Language Model

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.781560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.781560Z digest=sha256:68dabcedb77746c2ec9352b5c46aedb4e5807fca15fcecbcefb64a6e4f3a7b05

Observation d11eba53-b563-4566-8045-024fde1b974e · outbound

This paper cites Fast Transformer Decoding: One Write-Head is All You Need.

Supernova: Achieving More with Less in Transformer Architectures Fast Transformer Decoding: One Write-Head is All You Need

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.787144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.787144Z digest=sha256:70fdaacb85514662cf5a683ad5c27bdb20ddba565e5bc26296b58438a6dc05ae

Observation 336e5187-496b-4861-b556-f88c7814ee84 · outbound

This paper cites GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.

Supernova: Achieving More with Less in Transformer Architectures GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.792837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.792837Z digest=sha256:a8899a194a4a2b2f1e00ead3a94c13dd7adfc8bdc0523dd2374ed1196a321b24

Observation 1341b25f-ce54-429d-8299-968cc77b1380 · outbound

This paper cites Layer Normalization.

Supernova: Achieving More with Less in Transformer Architectures Layer Normalization

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.797836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.797836Z digest=sha256:c1afdb0a700424879233c2c6bbe1ca64a8c8d3f15c055f0d24d4374f01114469

Observation 60b43304-a96b-4fc6-9500-85abdb6a70c4 · outbound

This paper cites Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019.

Supernova: Achieving More with Less in Transformer Architectures Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.802741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.802741Z digest=sha256:44d7ecdba7c51124a74426d4ac5acce21e4fec2ec4d4ee78c7d3648f717106a7

Observation 20b91860-2f11-494c-9ab1-377d2724ef77 · outbound

This paper cites Language modeling with gated convolutional networks.International Conference on Machine Learning , pages 933–941, 2017.

Supernova: Achieving More with Less in Transformer Architectures Language modeling with gated convolutional networks.International Conference on Machine Learning , pages 933–941, 2017

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:29:55.187464Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:29:54.807155Z digest=sha256:d025637ac6ce9036b681e1f2b5dd2b34b5b5f791efc749b725b6f5893f3e3772

Observation a1dad2b3-adf3-42c5-b285-c1e26204d926 · outbound

This paper cites GLU Variants Improve Transformer.

Supernova: Achieving More with Less in Transformer Architectures GLU Variants Improve Transformer

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.812397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.812397Z digest=sha256:d455507c5b9588f177b2c2cf63a35ba5b065694ec1e68c7f26fa098b39a0316e

Observation 212bc820-8b48-4381-919b-7ef2f9913709 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

Supernova: Achieving More with Less in Transformer Architectures PaLM: Scaling Language Modeling with Pathways

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.817370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.817370Z digest=sha256:dc5e63c22529fc443faba8e603fefad218bee331ca9dc228c5b801ba221ce595

Observation a2aa7d57-4fc9-4169-971a-822793485027 · outbound

This paper cites Neural machine translation of rare words with subword units.

Supernova: Achieving More with Less in Transformer Architectures Neural machine translation of rare words with subword units

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:29:55.170604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:29:54.822681Z digest=sha256:a5ae1152a099b6e7870bcb17906bdbfa0aeb8bc26c21dc6181356b997bbcf9b8

Observation a12f0412-698e-4ae9-8ab8-436d5878f182 · outbound

This paper cites Byte pair encoding is suboptimal for language model pre- training.

Supernova: Achieving More with Less in Transformer Architectures Byte pair encoding is suboptimal for language model pre- training

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:29:55.155427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:29:54.827752Z digest=sha256:bbf87f3272b962097e137aedf5a40fd5c7c948a21b867ab666157bea0a3c8086

Observation 34d8732a-d737-4ae6-b7e8-a280f3e7dabb · outbound

This paper cites an unresolved cited work.

Supernova: Achieving More with Less in Transformer Architectures Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-06T15:29:55.139297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-06T15:29:54.832350Z digest=sha256:7a86b0978b531d753570bc79e91b06b408b34c4a21b7e6bc64c87474b2da6abf

Observation 3275c2c9-fecb-43dc-9e70-da1cf701be01 · outbound

This paper cites Textbooks Are All You Need.

Supernova: Achieving More with Less in Transformer Architectures Textbooks Are All You Need

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.837022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.837022Z digest=sha256:6ddbf0516ebffc0cefa8fb1a494950efc63132282efb144066065c0e69134a8b

Observation 02c786c9-768c-49f1-a0b8-4b6e3057179d · outbound

This paper cites Stable LM 2 1.6B Technical Report.

Supernova: Achieving More with Less in Transformer Architectures Stable LM 2 1.6B Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.841438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.841438Z digest=sha256:376096c07f4cac2a11707021f445ae875baa237f141945051a9e83e209bfb992

Observation 2d00e7bc-1714-42b2-8332-69ea21f8da41 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Supernova: Achieving More with Less in Transformer Architectures Gemma: Open Models Based on Gemini Research and Technology

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.846247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.846247Z digest=sha256:6c3426d41c7b0e036c4e79324dbf1bf6bde9e4400e39a7ab2a21ffcfa0562abc

Observation 5df4b5fa-9275-4f5e-aa9b-b4a14bf91e39 · outbound

This paper cites Scaling Laws for Neural Language Models.

Supernova: Achieving More with Less in Transformer Architectures Scaling Laws for Neural Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.851185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.851185Z digest=sha256:e5e859739a7713bebad3ec4ed307a755e4ddea98a235dd36802f4030ad4b6fd7

Observation 09a9d5ea-e062-4abe-9e1b-5504efcc3ee2 · outbound

This paper cites Training Compute-Optimal Large Language Models.

Supernova: Achieving More with Less in Transformer Architectures Training Compute-Optimal Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.856404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.856404Z digest=sha256:31b00353e6b2710a45708019027dad50a1f4b6119ee36dd6ea41b4eb70ac6563

Observation 9ed90807-a9b7-4aef-880f-a1eb6ab2360b · outbound

This paper cites Scaling Data-Constrained Language Models.

Supernova: Achieving More with Less in Transformer Architectures Scaling Data-Constrained Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.862049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.862049Z digest=sha256:d55c23f8b935eb24779fae02d85faff43858f94ba50658c775a388b3728dcf60

Observation ad5398d7-1a52-4244-bdf8-a35b0ecc6dd3 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Supernova: Achieving More with Less in Transformer Architectures LLaMA: Open and Efficient Foundation Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.867626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.867626Z digest=sha256:f3f05eca53bb0e490e2a676a3bd1debbe60f79c66267fe783a612f79fd6efd21

Pith citing papers

No inbound Pith citation observations are available.