Pith. sign in

Paper Citation Record · LEDGER

Supernova: Achieving More with Less in Transformer Architectures

As of 20 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.15773.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.15773 v2

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:29:54.867626Z

measured 22 of 22 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 873e7234-a520-4a73-b01c-7b87849f185a · outbound

This paper cites Attention is all you need.Advances in neural information processing systems, 30, 2017.

Supernova: Achieving More with Less in Transformer Architectures Attention is all you need.Advances in neural information processing systems, 30, 2017

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.759976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.759976Z digest=sha256:336f38ff03629fccd3b14ff5647309f82dadd24ec15146e45672a5e477d2c1c5

Observation 91e15f32-f3eb-482a-bfb4-baa52963afdf · outbound

This paper cites Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019.

Supernova: Achieving More with Less in Transformer Architectures Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.764915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.764915Z digest=sha256:96977abfae63363ebaf6645e93545fcf1a337055682496cc2099f1aaab8974e8

Observation 134bb493-ef2b-4749-9a81-67f508589e2a · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Supernova: Achieving More with Less in Transformer Architectures BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.769768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.769768Z digest=sha256:0b9d0004fab6b63e5f49fc15a25bea8108fa6c35ae1f85d3a1ba13ca82fd87ad

Observation 035b3f49-bd53-4177-9e9f-d631df31a567 · outbound

This paper cites RoFormer: Enhanced Transformer with Rotary Position Embedding.

Supernova: Achieving More with Less in Transformer Architectures RoFormer: Enhanced Transformer with Rotary Position Embedding

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.775014Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.775014Z digest=sha256:1594185eaf66249372c4462414661724411449cea9e4a1b6920aa794f81810a5

Observation 81d75129-1e8e-43d0-aa96-c1c6ad580f70 · outbound

This paper cites GPT-NeoX-20B: An Open-Source Autoregressive Language Model.

Supernova: Achieving More with Less in Transformer Architectures GPT-NeoX-20B: An Open-Source Autoregressive Language Model

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.781560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.781560Z digest=sha256:87198ee66e12e121a4e85b7de27b2003dd0c40eb11c6c30d94a7ba9433536cc5

Observation d11eba53-b563-4566-8045-024fde1b974e · outbound

This paper cites Fast Transformer Decoding: One Write-Head is All You Need.

Supernova: Achieving More with Less in Transformer Architectures Fast Transformer Decoding: One Write-Head is All You Need

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.787144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.787144Z digest=sha256:ce5dd95ba2289b3cd5fc800f4f2d97e0bd32309a54122ee1a763aadaa81ace9f

Observation 336e5187-496b-4861-b556-f88c7814ee84 · outbound

This paper cites GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints.

Supernova: Achieving More with Less in Transformer Architectures GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.792837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.792837Z digest=sha256:ff7f1ba5ffe309a34e603295424b40cb673f97a322bb817cb77a55bd4132d4e2

Observation 1341b25f-ce54-429d-8299-968cc77b1380 · outbound

This paper cites Layer Normalization.

Supernova: Achieving More with Less in Transformer Architectures Layer Normalization

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.797836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.797836Z digest=sha256:f14d0a5df8634c99d6685a99bf83033239e42414ae653f0aa3e353f46faf24a9

Observation 60b43304-a96b-4fc6-9500-85abdb6a70c4 · outbound

This paper cites Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019.

Supernova: Achieving More with Less in Transformer Architectures Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.802741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.802741Z digest=sha256:bf72d5156764eb2fee7a5f3b661169be1f824ddadb1847f5f387448eea3c77d4

Observation 20b91860-2f11-494c-9ab1-377d2724ef77 · outbound

This paper cites Language modeling with gated convolutional networks.International Conference on Machine Learning , pages 933–941, 2017.

Supernova: Achieving More with Less in Transformer Architectures Language modeling with gated convolutional networks.International Conference on Machine Learning , pages 933–941, 2017

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:29:55.187464Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T15:29:54.807155Z digest=sha256:5013a4e9d4c5c3f257ab656f009c6510274ebea32ab7fac43f3b749754f18de8

Observation a1dad2b3-adf3-42c5-b285-c1e26204d926 · outbound

This paper cites GLU Variants Improve Transformer.

Supernova: Achieving More with Less in Transformer Architectures GLU Variants Improve Transformer

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.812397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.812397Z digest=sha256:a0a52d96c740a67a2107a345a9906406a95e3e328e3bf9e7c5c3773d2853fe95

Observation 212bc820-8b48-4381-919b-7ef2f9913709 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

Supernova: Achieving More with Less in Transformer Architectures PaLM: Scaling Language Modeling with Pathways

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.817370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.817370Z digest=sha256:a8f897f5ae1aa637b1a4d11df1f31d3a1418faaf945006a8affab35bba2871af

Observation a2aa7d57-4fc9-4169-971a-822793485027 · outbound

This paper cites Neural machine translation of rare words with subword units.

Supernova: Achieving More with Less in Transformer Architectures Neural machine translation of rare words with subword units

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:29:55.170604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T15:29:54.822681Z digest=sha256:8414d7258480a980ec1b7fb436944449246615a0b6adbc906c7b04f8c86772d2

Observation a12f0412-698e-4ae9-8ab8-436d5878f182 · outbound

This paper cites Byte pair encoding is suboptimal for language model pre- training.

Supernova: Achieving More with Less in Transformer Architectures Byte pair encoding is suboptimal for language model pre- training

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:29:55.155427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T15:29:54.827752Z digest=sha256:cfb7574a68a16c8f5c5f034bc363dd0556b4fdc3012c9ffe7b0c7450c2fbfba2

Observation 34d8732a-d737-4ae6-b7e8-a280f3e7dabb · outbound

This paper cites an unresolved cited work.

Supernova: Achieving More with Less in Transformer Architectures Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-06T15:29:55.139297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-06T15:29:54.832350Z digest=sha256:0b90e91fdc2758f8b3d8d28a3c84e559597926fe215a9426540187f76997b79c

Observation 3275c2c9-fecb-43dc-9e70-da1cf701be01 · outbound

This paper cites Textbooks Are All You Need.

Supernova: Achieving More with Less in Transformer Architectures Textbooks Are All You Need

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.837022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.837022Z digest=sha256:2992257f9b9963df6a2125e8fcd10f23e9a26ccc21e8a0c824380781df1af23c

Observation 02c786c9-768c-49f1-a0b8-4b6e3057179d · outbound

This paper cites Stable LM 2 1.6B Technical Report.

Supernova: Achieving More with Less in Transformer Architectures Stable LM 2 1.6B Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.841438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.841438Z digest=sha256:2ae86874d8759df0d3f01a50a7e0e18b03ef049c3b3a2bb6849f0c7008d7cd6b

Observation 2d00e7bc-1714-42b2-8332-69ea21f8da41 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Supernova: Achieving More with Less in Transformer Architectures Gemma: Open Models Based on Gemini Research and Technology

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.846247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.846247Z digest=sha256:3fceaa6d162a7318d8a31b50d4245083c7417c584ce603f05978af0234041dc5

Observation 5df4b5fa-9275-4f5e-aa9b-b4a14bf91e39 · outbound

This paper cites Scaling Laws for Neural Language Models.

Supernova: Achieving More with Less in Transformer Architectures Scaling Laws for Neural Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.851185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.851185Z digest=sha256:4e0503aa5a2b073f919ec1657472991006154ec6114fe9c166fcd5f81ea40ca4

Observation 09a9d5ea-e062-4abe-9e1b-5504efcc3ee2 · outbound

This paper cites Training Compute-Optimal Large Language Models.

Supernova: Achieving More with Less in Transformer Architectures Training Compute-Optimal Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.856404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.856404Z digest=sha256:a18a1de7c88832632b474b70e868c0a152823440fdfc42901e1aa93d2fc7d0a2

Observation 9ed90807-a9b7-4aef-880f-a1eb6ab2360b · outbound

This paper cites Scaling Data-Constrained Language Models.

Supernova: Achieving More with Less in Transformer Architectures Scaling Data-Constrained Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.862049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.862049Z digest=sha256:5cf84283697954feb1772b44e99eca29d7c24934091a0c52f5c576f9ba1859b2

Observation ad5398d7-1a52-4244-bdf8-a35b0ecc6dd3 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Supernova: Achieving More with Less in Transformer Architectures LLaMA: Open and Efficient Foundation Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T15:29:54.867626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:29:54.867626Z digest=sha256:23e7a9e58cfc2409176501c0b652440253fdce64cba0f6fac25cfffa78720457

Pith citing papers

No inbound Pith citation observations are available.