{"as_of":"2026-08-16T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec281ff9f53199441a06cc60a0ae1b805f3b2c3803693fa7e9161263538d7419","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:54.867626Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15773/citation-record","integrity":"/paper/2507.15773/integrity","json":"/paper/2507.15773/citation-record.json","paper":"/paper/2507.15773"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:54.759976Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.759976Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:a4693cd932725351de285e34752aa9fc3bde31f0427e1e3fd29ecf9c85974198","observation_id":"873e7234-a520-4a73-b01c-7b87849f185a","resolution":{"observed_at":"2026-08-06T15:29:54.759976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:54.764915Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.764915Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:56b36168bad40c7bd6ae7d41895ca938e32927cfac6250b915832224aa34e183","observation_id":"91e15f32-f3eb-482a-bfb4-baa52963afdf","resolution":{"observed_at":"2026-08-06T15:29:54.764915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T15:29:54.769768Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.769768Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:f0baf7d54a59df7c46ce7c19d7f8f1baed8ce69ee608ddd3bca90f0f17080326","observation_id":"134bb493-ef2b-4749-9a81-67f508589e2a","resolution":{"observed_at":"2026-08-06T15:29:54.769768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-16T13:22:03.013938Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T15:29:54.775014Z","title":"Roformer: Enhancedtransformer with rotary position embedding.arXiv preprint arXiv:2104.09864 , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.775014Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:9dc9729d6725261f1dcef94bfb65628a5d3332fbde418df13618c512de0a4bdb","observation_id":"035b3f49-bd53-4177-9e9f-d631df31a567","resolution":{"observed_at":"2026-08-06T15:29:54.775014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-06T15:29:54.781560Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.781560Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:05eca7dfeb0cf0dba51265f08ccd544616b84cff766cf6a601fe4ed04e3c21bd","observation_id":"81d75129-1e8e-43d0-aa96-c1c6ad580f70","resolution":{"observed_at":"2026-08-06T15:29:54.781560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-06T15:29:54.787144Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.787144Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:1532a89983a8c00668824c136dd3e6b26c45c369c074db4282373d0edd4c6585","observation_id":"d11eba53-b563-4566-8045-024fde1b974e","resolution":{"observed_at":"2026-08-06T15:29:54.787144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-06T15:29:54.792837Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.792837Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:810782ed3b538545cbf5027c22ba1b3c1df30ee26a73c95e1206b3e9672a2d0c","observation_id":"336e5187-496b-4861-b556-f88c7814ee84","resolution":{"observed_at":"2026-08-06T15:29:54.792837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T15:29:54.797836Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.797836Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:67526b28e1c2ea05a526c9374a0b212802e3f337b434e1dbfc29f6f08424d1f9","observation_id":"1341b25f-ce54-429d-8299-968cc77b1380","resolution":{"observed_at":"2026-08-06T15:29:54.797836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:54.802741Z","title":"Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.802741Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:e4dc2972107d1dd2457d8ae05f726da5f1b109832b04c1e6c33699f6a573faec","observation_id":"60b43304-a96b-4fc6-9500-85abdb6a70c4","resolution":{"observed_at":"2026-08-06T15:29:54.802741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.182355Z","title":"Language modeling with gated convolutional networks.International Conference on Machine Learning , pages 933–941, 2017","venue":null,"work_id":"bd4f4a84-2059-45a6-943b-f5583c91f3f8","year":2017},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.807155Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:cebe1eb7d06f7eb339988b9977de194a06dfc5d15cea38f9384a273c8858a8fb","observation_id":"20b91860-2f11-494c-9ab1-377d2724ef77","resolution":{"observed_at":"2026-08-06T15:29:55.187464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T15:29:54.812397Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202 , 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.812397Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:284b02a0832915d0059fc48de170520c38afb13bff1652c8956eb384590875cf","observation_id":"a1dad2b3-adf3-42c5-b285-c1e26204d926","resolution":{"observed_at":"2026-08-06T15:29:54.812397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-06T15:29:54.817370Z","title":"Palm: Scaling language modeling with pathways.arXiv preprint arXiv:2204.02311 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.817370Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:911c2bd52bf112979d8c9921eb6022b95652818503a3a51506d4e5f9eba122c2","observation_id":"212bc820-8b48-4381-919b-7ef2f9913709","resolution":{"observed_at":"2026-08-06T15:29:54.817370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.165688Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":"8f664389-4a97-442e-a8ba-600069bf97a5","year":2016},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.822681Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:f3cab8a19406d5ee4f30e3fab85323da830baf1dfa2d4f4139d2216eebf8b88d","observation_id":"a2aa7d57-4fc9-4169-971a-822793485027","resolution":{"observed_at":"2026-08-06T15:29:55.170604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.149972Z","title":"Byte pair encoding is suboptimal for language model pre- training","venue":null,"work_id":"e98d4bae-7bfa-484b-a22b-9003fbcbda8f","year":2020},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.827752Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:72ecbd7b3d69834e16cdd2e047d014914861857ead5af624c3d34101dc882a54","observation_id":"a12f0412-698e-4ae9-8ab8-436d5878f182","resolution":{"observed_at":"2026-08-06T15:29:55.155427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:55.134046Z","title":null,"venue":null,"work_id":"c7dfeabd-9d8c-4e94-a8a8-ebdc68eafcd4","year":2018},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.832350Z"},"links":{"citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:9a5fc4d0203c6eec225ca1ea8184cf5dec040f060e906b52bacc8377aff1e0fe","observation_id":"34d8732a-d737-4ae6-b7e8-a280f3e7dabb","resolution":{"observed_at":"2026-08-06T15:29:55.139297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T15:29:54.837022Z","title":"Textbooks are all you need.arXiv preprint arXiv:2306.11644 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.837022Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:445611a8b679f59842451136f00465344f471a98337e905766705546df5e7a50","observation_id":"3275c2c9-fecb-43dc-9e70-da1cf701be01","resolution":{"observed_at":"2026-08-06T15:29:54.837022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-16T14:14:46.903233Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-06T15:29:54.841438Z","title":"Stable lm 2 1.6b: Improving upon our previous language model with significantly improved training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.841438Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:54dc519a78eac7aac498e48d8b9a51e4e5c5af2df35f1fefe6d512cdc88e5416","observation_id":"02c786c9-768c-49f1-a0b8-4b6e3057179d","resolution":{"observed_at":"2026-08-06T15:29:54.841438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T15:29:54.846247Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.846247Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:6e24c830e9c5f42b1a18435a6899b937d6e8f5b34586341a6fae36871b46734d","observation_id":"2d00e7bc-1714-42b2-8332-69ea21f8da41","resolution":{"observed_at":"2026-08-06T15:29:54.846247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T15:29:54.851185Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.851185Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:8da5e814fcde30ea729ab34756302d16daeb27fb14be48ce9e6a83d272cc314c","observation_id":"5df4b5fa-9275-4f5e-aa9b-b4a14bf91e39","resolution":{"observed_at":"2026-08-06T15:29:54.851185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T15:29:54.856404Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.856404Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:98ee1826078d3204e5423b1cad48de289839d14f5b188443f67189e180f91d81","observation_id":"09a9d5ea-e062-4abe-9e1b-5504efcc3ee2","resolution":{"observed_at":"2026-08-06T15:29:54.856404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16264","snapshot_observed_at":"2026-08-06T15:29:54.862049Z","title":"Scaling data- constrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.862049Z"},"links":{"cited_paper":"/paper/2305.16264","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:268301fc4006cf0f25b9f30edf05059483c72651846422b12a38c7df603a8bd6","observation_id":"9ed90807-a9b7-4aef-880f-a1eb6ab2360b","resolution":{"observed_at":"2026-08-06T15:29:54.862049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T15:29:54.867626Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:54.867626Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.15773"},"observation_digest":"sha256:148f5eccfd7dd52b3ad84c983812fb7377b9d7176ea394e2b4e7a1f4022f415d","observation_id":"ad5398d7-1a52-4244-bdf8-a35b0ecc6dd3","resolution":{"observed_at":"2026-08-06T15:29:54.867626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15773","last_updated":"2025-07-22T13:27:02Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T13:24:22.754714Z","submitted_at":"2025-07-21T16:27:48Z","title":"Supernova: Achieving More with Less in Transformer Architectures"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.15773."}