{"as_of":"2026-08-17T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e670a4962c10a957e6d7728dc89acf45ceae4fd51d1578ff91b7213bad2bb16a","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:40:27.825037Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:31:30.334937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T07:43:11.766620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":"2504.14992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient pretraining length scaling","venue":null,"work_id":"c76b2922-66dd-4765-bebc-a1156d708d6c","year":2025},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-13T23:04:32.343355Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T07:43:11.620446Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:42a70706670a836829f6c09065356c12bebddbfa0bed4aa2bbc6b38028c9bc7b","observation_id":"9e028773-dd76-486a-a7fa-06f751cc643f","resolution":{"observed_at":"2026-05-15T07:43:11.770485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-08-04T07:31:30.334937Z","title":"Efficient pretraining length scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-13T23:04:32.343355Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T07:31:30.334937Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:3257a639b5bd5c9261f0f120aafe0f292c70df60d5432b621f40020e0d7f922d","observation_id":"b3c40fe4-0676-45ed-83ed-00fe7703e31f","resolution":{"observed_at":"2026-08-04T07:31:30.334937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Efficient pretraining length scaling.CoRR, abs/2504.14992, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:647222762681ac3adfcca8aa9d0e99d9126cb3e723ea55e2cfb7509e165b43c5","observation_id":"7003648e-fb23-457e-9306-e412ae4fdc60","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":"2504.14992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient pretraining length scaling","venue":null,"work_id":"c76b2922-66dd-4765-bebc-a1156d708d6c","year":2025},"citing_paper":{"arxiv_id":"2605.09630","last_updated":"2026-05-10T16:18:22Z","snapshot_observed_at":"2026-08-14T10:03:16.402043Z","submitted_at":"2026-05-10T16:18:22Z","title":"Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:28.713898Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2605.09630"},"observation_digest":"sha256:092b33f6acbdcb43739bac0a0122078e6ed173b13ec7f2360c6d82db64cd4599","observation_id":"f683faf2-3189-4eec-9029-366a612255d5","resolution":{"observed_at":"2026-05-12T06:36:29.285778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14992/citation-record","integrity":"/paper/2504.14992/integrity","json":"/paper/2504.14992/citation-record.json","paper":"/paper/2504.14992"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T11:40:27.558018Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.558018Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:6f98cfc8ebfd0237d436131c0a83ad92d8b453cb4a0b8a83bf07ab39949919c4","observation_id":"2a495a46-b68e-4c72-b08b-8ed75d565a47","resolution":{"observed_at":"2026-08-16T11:40:27.558018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.563405Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.563405Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:65080caf4d7543788050b6cd59c67e3b0c1860eb3436c88e2ce9483eb0bd2b8e","observation_id":"37f726f6-5bd4-452b-b1ee-51c5db3e5e8e","resolution":{"observed_at":"2026-08-16T11:40:27.563405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T11:40:27.567873Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.567873Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:ee8d68305564f4be563e008370724fc26095f4c9f3b0efb91d7988bc6884c0c3","observation_id":"15b54ffb-3f76-4735-b1f1-a3cc8cfe9928","resolution":{"observed_at":"2026-08-16T11:40:27.567873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.572503Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.572503Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:94ca4fcb1b2e47e493ccaf37fb378c793d70716b75250d62607ca31b74825b60","observation_id":"36e29e45-f8e2-4088-83a9-6c5861deb028","resolution":{"observed_at":"2026-08-16T11:40:27.572503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-16T11:40:27.576790Z","title":"Striped attention: Faster ring attention for causal transformers.CoRR, abs/2311.09431, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.576790Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:237df1317a8832c5d23934de58b52d87514a3f306342d546e3e00dbc2975f797","observation_id":"091c1abf-aee0-4067-8db9-777408e2aedd","resolution":{"observed_at":"2026-08-16T11:40:27.576790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-08-16T13:42:36.305570Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-16T11:40:27.581679Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.581679Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f1342387a395b1fff0c31fc88cc87430f4358285851123865e03a679e3dc8b3c","observation_id":"f0f1e1f3-92a8-43a5-b4ed-aa5dc82d590b","resolution":{"observed_at":"2026-08-16T11:40:27.581679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13842","last_updated":"2025-02-23T04:31:53Z","snapshot_observed_at":"2026-08-16T12:56:56.810802Z","submitted_at":"2025-02-19T16:02:23Z","title":"Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13842","snapshot_observed_at":"2026-08-16T11:40:27.586615Z","title":"Inner thinking transformer: Leveraging dynamic depth scaling to foster adaptive internal thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.586615Z"},"links":{"cited_paper":"/paper/2502.13842","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:fdbf68ee735962122f0cbd2ec5439f00e1abb64ea8867db296335c2dc42d24e7","observation_id":"a9ecf90b-d3f6-4c55-ae68-2d61dd38abc3","resolution":{"observed_at":"2026-08-16T11:40:27.586615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-16T11:40:27.591194Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.591194Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:57ec7c28ee31e953f336fdd0c5f17d86468a1b49b3cfdee6ec785cf731ce216b","observation_id":"d98a2357-b202-48e5-ad30-4a0bf0bd91ea","resolution":{"observed_at":"2026-08-16T11:40:27.591194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.595724Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.595724Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:c8fb0bfd94e0806837bc340057d9c469cdca0b48a070caacd2d906b864da5f63","observation_id":"b9e293a4-de22-4678-9395-6af6dcc67457","resolution":{"observed_at":"2026-08-16T11:40:27.595724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T11:40:27.599886Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.599886Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1912719948e0d78078ea5540ace3cc91b95f8f791936993041bed2194d5fde5a","observation_id":"80048c91-2a95-4320-867c-e50c8cc87163","resolution":{"observed_at":"2026-08-16T11:40:27.599886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:40:27.604174Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.604174Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d526522113c8ffc0f8e23cc225313bbe3178bc7a098bb9e206ecc099917e2e2c","observation_id":"665c3ae4-19f4-4b9f-bc13-659ac7dbb42b","resolution":{"observed_at":"2026-08-16T11:40:27.604174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.812170Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"fdede0d6-e945-4166-9a1b-3ff17ad1f549","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.608654Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2fbb4cc821a0126e1a2ec2591adbb398228926f9a6fb2d9c00260f1c89df7589","observation_id":"8a8c855b-09c9-45d8-a140-9ace5b336d3f","resolution":{"observed_at":"2026-08-16T11:40:28.816535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.798828Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"9cf136b5-274b-4bc3-90d3-0e80031ffa06","year":2022},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.612738Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:95a39daae8fa1ab933d36bd8e73c577e8cbf96a2376840964fb7643ea8281279","observation_id":"c858dc2e-bee8-45ca-b2d5-c2fbc0795e09","resolution":{"observed_at":"2026-08-16T11:40:28.803359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.785570Z","title":"Flash-decoding for long-context inference, October","venue":null,"work_id":"78ba6b57-96b2-4f7c-ba5e-31377dd18e6b","year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.616727Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2ba14ec18567b347c5c17cb0e84ddc5120d6a996ea8d243bdddee4a1b3139a8e","observation_id":"a35e5cf4-34aa-4230-be4f-26896c2c47d0","resolution":{"observed_at":"2026-08-16T11:40:28.789928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-16T15:18:27.962961Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-16T11:40:27.624969Z","title":"Longnet: Scaling transformers to 1, 000, 000, 000 tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.624969Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:e2fc108b89c9280bc0da109aa03cc17159ecffe6604364148e6cdbe504b485a2","observation_id":"0fcddfd9-b261-4dee-aa43-098683fe5ded","resolution":{"observed_at":"2026-08-16T11:40:27.624969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-08-15T00:53:48.099058Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-16T11:40:27.629386Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.629386Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:3841b49089fde8514e550b6a50646807acb2aa1cf7ffbf99bdb6ac0baea3bd6a","observation_id":"90fe73a9-05d6-4945-bf02-11a2bcb339ef","resolution":{"observed_at":"2026-08-16T11:40:27.629386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.759374Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":"ba683c69-af94-43c0-a389-17e27c603cf2","year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.634029Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:34af99ea34db4776194d42abcf908c58499f1fec8419c780a5eb44a88e4de0da","observation_id":"c26e4082-807b-40ae-a037-b99d19b14464","resolution":{"observed_at":"2026-08-16T11:40:28.763606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:40:27.638548Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.638548Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:78cf8badf1052b295eacdb0a4fa61ed42de3132be1727ede737005984164e382","observation_id":"92849502-2711-40bf-ae22-62a82284aab2","resolution":{"observed_at":"2026-08-16T11:40:27.638548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00930","last_updated":"2024-04-01T05:19:34Z","snapshot_observed_at":"2026-08-16T14:04:44.801881Z","submitted_at":"2024-04-01T05:19:34Z","title":"PSYDIAL: Personality-based Synthetic Dialogue Generation using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00930","snapshot_observed_at":"2026-08-16T11:40:27.642741Z","title":"Psydial: personality-based synthetic dialogue generation using large language models.arXiv preprint arXiv:2404.00930, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.642741Z"},"links":{"cited_paper":"/paper/2404.00930","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:22aec66ae4cd6db23f0c345ae4b2673afdbd7943e7636aa50defface3181d780","observation_id":"3f7478eb-756e-4cf2-aecd-d02af900b175","resolution":{"observed_at":"2026-08-16T11:40:27.642741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-17T06:12:37.525438Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-16T11:40:27.646890Z","title":"Training large language models to reason in a continuous latent space.arXiv preprint arXiv:2412.06769, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.646890Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:cb6001e6a5c97e93c941fbff9162dec73bd11aeb3c558d6281a55051a5ea9ea5","observation_id":"80155363-9798-4441-97c7-6b2949a45db3","resolution":{"observed_at":"2026-08-16T11:40:27.646890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T11:40:27.651372Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.651372Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:64aa7f1627bed63bc429cd67770f95d7540899171232e02a24162ea6a46bf5d4","observation_id":"7afb1830-a59a-4eaf-b75e-33d7f4ffe78f","resolution":{"observed_at":"2026-08-16T11:40:27.651372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-16T11:40:27.655454Z","title":"Scaling laws for transfer.arXiv preprint arXiv:2102.01293, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.655454Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:77d7692a592971112b3e804ea6fa124e3a08a45d796ffda019a44cad3167d538","observation_id":"209e70b9-66b9-4053-bb77-0f80cd91d6c9","resolution":{"observed_at":"2026-08-16T11:40:27.655454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-16T14:46:31.226431Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-16T11:40:27.659632Z","title":"Flashdecoding++: Faster large language model inference on gpus.CoRR, abs/2311.01282, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.659632Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d048285d77c87cd1cb14018c6866c4a7f7d742449646db8b9377d8ff231b68c5","observation_id":"f1b9f26b-e458-4b6f-9015-6ba6d282e343","resolution":{"observed_at":"2026-08-16T11:40:27.659632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:40:27.664264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.664264Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:45772367a3ddfd897c2142e289aa99e95637ba6051a05b5e0884d35caddd414a","observation_id":"163c4d11-ee79-453a-af08-6709b56dad43","resolution":{"observed_at":"2026-08-16T11:40:27.664264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.669416Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.Advances in Neural Information Processing Systems, 37:52481–52515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.669416Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:60f78aeec4e0f26e0a468c7be6ba5ef56a4ed8c9e2bda311b3d88a16cae9105b","observation_id":"ca625383-aefd-4784-9ef3-633c5428580e","resolution":{"observed_at":"2026-08-16T11:40:27.669416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.673545Z","title":"Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.673545Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:36324de41cfe379c2f5d08047e7406a6653bdbe94e364978495e7ded61233a4c","observation_id":"a06f4371-7320-412d-91cd-c08c3daec77f","resolution":{"observed_at":"2026-08-16T11:40:27.673545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-16T11:40:27.677625Z","title":"Swe-bench: Can language models resolve real-world github issues?arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.677625Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:73d7e836c5ada1034e5f11d6b533c73e609037575a65159eed8e18afd390ceb5","observation_id":"497d90ed-2ef1-463c-818a-3a55a1e04edd","resolution":{"observed_at":"2026-08-16T11:40:27.677625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:40:27.681973Z","title":"Scaling laws for neural language models.arXiv preprintarXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.681973Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:e7afb371e19b8911dfac19a56db4eb476e3a695fa0838ff1e3584fa9309502f6","observation_id":"7e232f65-c2fc-48fb-afb6-a44fe20f03a4","resolution":{"observed_at":"2026-08-16T11:40:27.681973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.686173Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.686173Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d037bc15cb895a0c75e555bf831e503bfacac7473eba171870cd07688b8ee0a1","observation_id":"1a5ddb20-51a2-40f5-a640-73dd082d3a0f","resolution":{"observed_at":"2026-08-16T11:40:27.686173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.690438Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.690438Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:24f07b1bc0101e4079c0172846c85ea07f2b0c2e8f0409b279b2cf7dcf8432e0","observation_id":"3437b068-4646-4092-950c-17ae22082461","resolution":{"observed_at":"2026-08-16T11:40:27.690438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-08-13T08:34:05.764059Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-16T11:40:27.694729Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.694729Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f7290108a9b1fced14d7e475eae4a70d2af9d26fe60b133ab11eb9833025a6c3","observation_id":"a9cee53b-3d09-4738-9c19-20f8869de968","resolution":{"observed_at":"2026-08-16T11:40:27.694729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-16T11:40:27.698916Z","title":"Snapkv: LLM knows what you are looking for before generation.CoRR, abs/2404.14469,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.698916Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:324c893658596b849fc988daa5b2c6c062592888854ced75569f161de08dec75","observation_id":"31d8bb76-a3fe-4582-a07b-bc8dbe2f1d63","resolution":{"observed_at":"2026-08-16T11:40:27.698916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-16T11:40:27.708789Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.708789Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:a2e6de11df093e527b5726389ed15c3cc25d7bd026f390588a09ab8ff2895b3d","observation_id":"689cae58-4f74-4dae-b1f9-6d8c08e0d3ea","resolution":{"observed_at":"2026-08-16T11:40:27.708789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T11:40:27.713440Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.713440Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:aec814c8a5bcf61fd77d6f55b085222a31741c8b9364415ba76a64fac69fb09c","observation_id":"e171f76d-316f-4c7e-ac7e-db93ce48ec98","resolution":{"observed_at":"2026-08-16T11:40:27.713440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-16T11:40:27.717780Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.717780Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:df0e13fbb424d91649143e00c2a8846b6ce2ef872d82b87c56c11aba1e1a5bac","observation_id":"b540b48a-e3b9-4079-bcf0-63075bde9b1f","resolution":{"observed_at":"2026-08-16T11:40:27.717780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.727866Z","title":"Cotformer: More tokens with attention make up for less depth","venue":null,"work_id":"acc194b8-0166-454a-9894-8a19c4c038f8","year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.722872Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:a722232a04f2fb59f12f729e240b03360f34e82dfff5e54e9f4f646ffe191348","observation_id":"6970b460-588e-45a6-a150-d711cd57ba0a","resolution":{"observed_at":"2026-08-16T11:40:28.733667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-16T11:40:27.726822Z","title":"2 olmo 2 furious.arXiv preprint arXiv:2501.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.726822Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:ed6209febf23f976185cfd8ecb1e6abbb65270b9ca5553c552b40392e8222d13","observation_id":"10601342-b229-4e83-bc93-b1f013364f00","resolution":{"observed_at":"2026-08-16T11:40:27.726822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.730983Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.730983Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:cf7e001be0482250fd6d332c4da9a9cf0b73daa5c168d03f90776ab0f7310074","observation_id":"cf7b5a91-4723-42d9-911b-62c308fbc876","resolution":{"observed_at":"2026-08-16T11:40:27.730983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.735013Z","title":"Learning to reason with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.735013Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:b54f3c61fc76e4efbbad8c0511ec3d1d72456ddf9ed19396ba043a03508d9dc6","observation_id":"e15b3320-6f79-4d74-be8f-d37b62ddbe0a","resolution":{"observed_at":"2026-08-16T11:40:27.735013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.738918Z","title":"Vicky Zhao, Lili Qiu, and Dongmei Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.738918Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:c6a2329302426fd8bfc7e6f600d59d37d444c68484f646a962a0c52764df7cf1","observation_id":"9e485649-1b75-42d9-b5bf-ab6eba06eb3f","resolution":{"observed_at":"2026-08-16T11:40:27.738918Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.742943Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.742943Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:21470c8185bdf25ce84fb9c469cd1c4e6a3a9d457fe4a769859149aa5380f07d","observation_id":"a340972b-df2c-4a84-a40c-c1ea645abdda","resolution":{"observed_at":"2026-08-16T11:40:27.742943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-08-16T14:36:33.398897Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-16T11:40:27.747393Z","title":"Sparq attention: Bandwidth-efficient llm inference.arXiv preprint arXiv:2312.04985, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.747393Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:7e3772c10daf2bb875d63f8baac0f1f614e7fc31ae510b957518b77fa5e60216","observation_id":"e4498814-6522-4633-b142-e43347dd63db","resolution":{"observed_at":"2026-08-16T11:40:27.747393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.751446Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.751446Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:9c26764296e4f76f48304523e826b570c3b48eca4770429ed81279f7e37ea58a","observation_id":"91e7e568-39a5-4459-84a7-f28fa8143952","resolution":{"observed_at":"2026-08-16T11:40:27.751446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:40:27.755193Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.755193Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d6717dbbf69a791f18ea6c07e1a22f6c6b4f67266bf445c53e795488e165b3b9","observation_id":"942dcaf6-5bca-4dae-a22d-3cede4caf60c","resolution":{"observed_at":"2026-08-16T11:40:27.755193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-16T11:15:38.109255Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-16T11:40:27.759136Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.CoRR, abs/2407.08608, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.759136Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1abcc424430f3094827e68a43dfdd03805867b8b7a36c6d1b2f92a4ac8c1a513","observation_id":"5ae0e7c7-7d5d-4826-8039-6c42aebce566","resolution":{"observed_at":"2026-08-16T11:40:27.759136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T11:40:27.763275Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.763275Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d6be630fbb0154c9277b5679bf15d1040be9a8891a50785ea0599cf93f377b77","observation_id":"a1ac3a2b-439b-4ba0-b529-fe90cf13ed15","resolution":{"observed_at":"2026-08-16T11:40:27.763275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.672419Z","title":"Sparsebert: Rethinking the importance analysis in self-attention","venue":null,"work_id":"d73775a0-caeb-4d2d-9ae6-13c2ed670af2","year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.767431Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:21bd928f087ba2c32d15d197a8c333e5731219a89eead5e63d896e6812b4ee25","observation_id":"cdf1eecf-8b62-4f5e-81d5-ed42dee80707","resolution":{"observed_at":"2026-08-16T11:40:28.676571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-14T07:35:42.261374Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-16T11:40:27.771507Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.771507Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:622a74386088287de8a06411b97966dd5d2be8ea0dbe5020b3ca5ec36c8179a5","observation_id":"ffa160b7-62b5-4451-9cee-ba8cc6e5f20b","resolution":{"observed_at":"2026-08-16T11:40:27.771507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-14T18:05:06.623407Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-16T11:40:27.775667Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge.arXiv preprint arXiv:1811.00937, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.775667Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1c4703d6a18dd0e659f9561cf487112d6045d5beecbfc4262795bbb1ba140576","observation_id":"9651b31e-bf8a-4581-8fe1-d93d9bb3bc07","resolution":{"observed_at":"2026-08-16T11:40:27.775667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.659110Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":"f58a50af-36d9-417d-856e-fed2139bc5d5","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.780307Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:801c3d300423ff591b31299a713714c8e9280d53b84cd7ee4e7cee7039d9ef4a","observation_id":"62ff530d-9287-492f-8f52-d4e11f830858","resolution":{"observed_at":"2026-08-16T11:40:28.663361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T11:40:27.784477Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.784477Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:87e4ff81cf3a192693dd8bc1eb97ed825de7e70f272548a652d01a72e8619d48","observation_id":"9cf96c16-855e-49a5-a497-93f7bf9a3a39","resolution":{"observed_at":"2026-08-16T11:40:27.784477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T11:40:27.788641Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.788641Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:6538c80bdd943b5ca72bc5843c9b3503e2ec14f0786fd728401f8e800527c03e","observation_id":"f878e569-4991-4ae0-9492-22124a6c8e85","resolution":{"observed_at":"2026-08-16T11:40:27.788641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.792728Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.792728Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:a098d2982c2353ae0e20c70f05e493e0a3c587975b2d85583f7a4ff7756e2d9f","observation_id":"d7008f2f-ee9d-4ac4-906b-d724213ddca8","resolution":{"observed_at":"2026-08-16T11:40:27.792728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.796755Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.796755Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2eee7e471a0425ae64c44d5999193211f091af138fe38e9c7619243c8f0c5522","observation_id":"087072a8-55d2-4a7f-9dfd-b557ca3f5767","resolution":{"observed_at":"2026-08-16T11:40:27.796755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.800794Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advancesin neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.800794Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:0cfa4165e3e5fe77c6865780bb697b86bfbab653f02dfaceb7d4d24666854ada","observation_id":"506aa59f-7d7a-4a29-8cb5-61cd03e2d6d7","resolution":{"observed_at":"2026-08-16T11:40:27.800794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.629445Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"78611350-49be-4904-b159-c505b14891b0","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.804971Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:4a340971e641e59dabd622220dcdff8e150f0af66f80800cd0267fa6aee9c7dd","observation_id":"b9b29f29-a0e1-4ad3-af00-201c0d2f4ad6","resolution":{"observed_at":"2026-08-16T11:40:28.633681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-16T11:40:27.808920Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.808920Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:51ccfb38649e25c8c2000180ac8e1eee27dfd1df5a8ad30e62a775838b488516","observation_id":"742911d0-84db-4836-a71b-037ca41da3bb","resolution":{"observed_at":"2026-08-16T11:40:27.808920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.615718Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"15a9d757-f8af-4b3b-91fc-bc59824f65b9","year":2020},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.813063Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f0da640c35964d95fe1e91efc2a38f508c2a6c4ba079b0c0a737af1ad1af1fa4","observation_id":"2cb9823b-4fc8-4f12-bf00-ca70efdd8d24","resolution":{"observed_at":"2026-08-16T11:40:28.620016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.601562Z","title":"Quiet-star: Language models can teach themselves to think before speaking","venue":null,"work_id":"6395459b-fc49-44c7-904e-da6edd67725b","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.816971Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:666906f791d2f7065578356189f7d453c59bda3d412216030709a58dd536a289","observation_id":"fccd7f9e-4885-43b9-83c7-359895c4e452","resolution":{"observed_at":"2026-08-16T11:40:28.606051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-16T11:40:27.820980Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.820980Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:4393034212de90e2479fe4968f19b71a5727cd8a3806641927dcd2653fd37558","observation_id":"d34e39bc-7abd-4d54-8354-81e1d36388c6","resolution":{"observed_at":"2026-08-16T11:40:27.820980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.585870Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"67793106-3755-4e88-8292-e8032ed3351b","year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.825037Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:522c0fca3318e8273c0d7f01dcee7e435f3ec1e4cff756df71bd61bc671b47a6","observation_id":"41be79ca-507e-42dd-9121-b032ca2660bb","resolution":{"observed_at":"2026-08-16T11:40:28.592405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.772852Z","title":"Accessed: 2024-9-29","venue":null,"work_id":"a018487e-e8f5-47cd-a31c-fd2acf48a0aa","year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.621049Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:99bd62fd0bf4afc2d6d26f5dd6b895b54d5481857bc3be31e9561cc867ac2822","observation_id":"100ce4b3-c7de-4b4b-953b-e3426844ab92","resolution":{"observed_at":"2026-08-16T11:40:28.776898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-16T11:40:27.704329Z","title":"URL https://doi.org/10.48550/arXiv.2404.14469","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.704329Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d3d8c144afe76207e3aedbd433d2a97fb34b99a868107ff15c162c625f6297b7","observation_id":"2cbdfd7b-e0f9-45b7-95e4-990a0b58189b","resolution":{"observed_at":"2026-08-16T11:40:27.704329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T04:17:38.423925Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 4 inbound Pith citation observations for arXiv:2504.14992."}