{"as_of":"2026-08-07T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d23e03761e891c779926dd6156f95abe63509be9ee6ff3091ee74688a14813a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T10:01:56.131253Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:20:16.164286Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-07-14T15:32:26.691504Z","title":"Why low-precision transformer training fails: an analysis on flash atten- tion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09800","last_updated":"2026-07-28T02:32:08Z","snapshot_observed_at":"2026-08-02T07:54:44.716900Z","submitted_at":"2026-07-09T15:23:42Z","title":"Reference Traces for Auditing Invisible Weight Updates and Guiding Exact-Budget Protection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T15:32:26.691504Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.09800"},"observation_digest":"sha256:5deeb0b756b3c92b05ccc8998014f6fcbd6abc62de42b3439d01f0b4a85164c8","observation_id":"d8e3f90e-889b-4d2a-94c3-39e22dfc17bc","resolution":{"observed_at":"2026-07-14T15:32:26.691504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-02T07:54:47.068638Z","title":"Why low-precision transformer training fails: An analysis on flash attention","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09800","last_updated":"2026-07-28T02:32:08Z","snapshot_observed_at":"2026-08-02T07:54:44.716900Z","submitted_at":"2026-07-09T15:23:42Z","title":"Reference Traces for Auditing Invisible Weight Updates and Guiding Exact-Budget Protection","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:54:47.068638Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.09800"},"observation_digest":"sha256:33203b5972d54a50b0108cfe35d8048ce6648450bd615877f29e0c3111b0a53c","observation_id":"ab61e964-02b0-4497-874c-767d0fae2e8b","resolution":{"observed_at":"2026-08-02T07:54:47.068638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-01T11:54:35.779079Z","title":"Qiu and Q","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19771","last_updated":"2026-07-22T05:39:00Z","snapshot_observed_at":"2026-08-01T11:54:33.566920Z","submitted_at":"2026-07-22T05:39:00Z","title":"An Isotropy-Preserving Spectral Cap for Muon: Theory and Three Case Studies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:35.779079Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.19771"},"observation_digest":"sha256:5eededfeb57bdc32ccc82c33dfcfa16983dfbc9940b35396e98eea1e576fc869","observation_id":"55e5c0eb-4757-49d1-9eb8-3d238c96c5ab","resolution":{"observed_at":"2026-08-01T11:54:35.779079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-01T02:20:39.957037Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25494","last_updated":"2026-07-28T09:31:17Z","snapshot_observed_at":"2026-08-06T15:06:20.222746Z","submitted_at":"2026-07-28T09:31:17Z","title":"Automated Numerical Stability Analysis of Deep Learning Operators","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T02:20:39.957037Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2607.25494"},"observation_digest":"sha256:af11a6a3afccfef13ee81eb3680ac7ed99da104c4dbb97d2ee77bbc04508bed9","observation_id":"f11b71b5-ce65-43a5-9ff8-5b4734344cb7","resolution":{"observed_at":"2026-08-01T02:20:39.957037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04212","snapshot_observed_at":"2026-08-04T15:20:16.164286Z","title":"Why low-precision transformer training fails: An analysis on flash attention, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02091","last_updated":"2026-08-03T11:50:06Z","snapshot_observed_at":"2026-08-06T23:36:52.839331Z","submitted_at":"2026-08-03T11:50:06Z","title":"One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:20:16.164286Z"},"links":{"cited_paper":"/paper/2510.04212","citing_paper":"/paper/2608.02091"},"observation_digest":"sha256:7669ab5c2f994abe2bb4e9d5e4221ddbe260d0087935281ea73642f13ecbe9b1","observation_id":"55a7f5a8-c489-48d9-a2be-bfe3e7067fcb","resolution":{"observed_at":"2026-08-04T15:20:16.164286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.04212/citation-record","integrity":"/paper/2510.04212/integrity","json":"/paper/2510.04212/citation-record.json","paper":"/paper/2510.04212"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17353","last_updated":"2024-07-24T15:26:01Z","snapshot_observed_at":"2026-08-05T22:30:03.500844Z","submitted_at":"2024-07-24T15:26:01Z","title":"Scalify: scale propagation for efficient low-precision LLM training","version":1},"cited_work":{"arxiv_id":"2407.17353","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17353","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalify: scale propagation for efficient low-precision llm training.arXiv preprint arXiv:2407.17353","venue":null,"work_id":"0feb4a58-8d98-4b7d-a867-c4a42b0f1230","year":null},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2407.17353","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:865b5d979a3730578857fc630d8a33383276cebb65ca834016b89d83f384f882","observation_id":"84ef2b0d-6d00-4360-8707-47ea35c43375","resolution":{"observed_at":"2026-05-18T10:02:31.677451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17465","last_updated":"2025-01-10T14:22:02Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-24T17:58:42Z","title":"u-$\\mu$P: The Unit-Scaled Maximal Update Parametrization","version":3},"cited_work":{"arxiv_id":"2407.17465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17465","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"u-µp: The unit- scaled maximal update parametrization.arXiv preprint arXiv:2407.17465","venue":null,"work_id":"ceefab8a-2f82-4c5c-9707-1b9ca6fcbc6b","year":null},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2407.17465","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:f7d0e0e7e6c231d67f5d69fbfe323cfa7c08bb5bb538c80634067af44005df45","observation_id":"c8ce8386-332b-4824-a827-d4101c1410d5","resolution":{"observed_at":"2026-05-18T10:02:31.733884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:57:14.742120Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"84780adb-76cf-44ac-a8b7-e24d4fa5c592","year":1901},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:307bedb9069d3fbd1a615565af8d3ac89ceda9ba2c76992741ad7a97950d6979","observation_id":"acad3c74-c1c2-4dc6-bcbf-cf9f912f814c","resolution":{"observed_at":"2026-05-18T10:02:31.810103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-04T18:48:38.871823Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":"2409.12517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-07-03T07:27:44.431731Z","title":"Scaling FP8 Training to Trillion- Token LLMs","venue":null,"work_id":"67213178-57f3-4231-9e3e-3545902d31de","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:494af26d3974c354ca9ba8e2a69492d9b36ddd9f0d52afc2b5bf84a990b27da7","observation_id":"2747e26a-663e-407e-9239-46432204b867","resolution":{"observed_at":"2026-05-18T10:02:31.710568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aaron Gokaslan, Vanya Cohen, Ellie Pavlick, and Stefanie Tellex","venue":null,"work_id":"24ce4a00-5065-4018-8ad7-94215dc5b639","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:d9525e0e0675248c285a5cca4c9752578ad70a32e25126320e389165a93bcf92","observation_id":"a45bdfba-62a7-40cd-8e79-c5196ab742e5","resolution":{"observed_at":"2026-05-18T10:02:31.806824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02803","last_updated":"2024-05-05T03:25:25Z","snapshot_observed_at":"2026-07-06T18:09:55.249620Z","submitted_at":"2024-05-05T03:25:25Z","title":"Is Flash Attention Stable?","version":1},"cited_work":{"arxiv_id":"2405.02803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.02803","snapshot_observed_at":"2026-07-03T05:07:38.312172Z","title":"Is flash attention stable?","venue":null,"work_id":"e4a589ee-4499-4492-bb04-3ebb3ea0233d","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2405.02803","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:bcfa1661ac16203f5bd92635f2d1e94cae47e1d013d6c662fd7f46c604de582b","observation_id":"0a266c88-bd65-4dac-bdbe-67731ecbcadc","resolution":{"observed_at":"2026-05-18T10:02:31.719792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01043","last_updated":"2026-07-29T08:00:39Z","snapshot_observed_at":"2026-08-06T10:26:19.300864Z","submitted_at":"2025-05-02T06:33:25Z","title":"Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities","version":2},"cited_work":{"arxiv_id":"2505.01043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.01043","snapshot_observed_at":"2026-07-30T01:18:51.459998Z","title":"Low-precision training of large language models: Methods, challenges, and opportunities","venue":null,"work_id":"bf4a3b3b-fb8b-47f4-bc34-9c5da16141a0","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.01043","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:061bb09bb156468b5cd1754bdfafa4c761521b02fe1bb4c4dae86ef8b9743cf8","observation_id":"51ef9cb5-1de1-4065-b39d-0102ff8bb07f","resolution":{"observed_at":"2026-07-30T01:18:51.459998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04245","last_updated":"2020-10-08T20:12:35Z","snapshot_observed_at":"2026-07-06T10:02:48.167825Z","submitted_at":"2020-10-08T20:12:35Z","title":"Query-Key Normalization for Transformers","version":1},"cited_work":{"arxiv_id":"2010.04245","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.04245","snapshot_observed_at":"2026-07-04T14:19:53.801066Z","title":"Query-key normal- ization for transformers","venue":null,"work_id":"df170a47-09f7-49ba-b2e5-6493efa0a095","year":2020},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2010.04245","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:05a43373b48ace52e34334c5a18761e9027633eeab56774c8ec3e895e67f3026","observation_id":"cc065a55-4627-413b-9d94-158782c9e583","resolution":{"observed_at":"2026-05-18T10:02:31.673927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:c096f2408874a68ad3f31c5096d6456c9b70c6f3bcbe2b53950b0e5cda1a184e","observation_id":"8f6b5e54-03fc-4290-a857-7034d2da5616","resolution":{"observed_at":"2026-05-18T10:02:31.752653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06842","last_updated":"2025-02-28T15:15:31Z","snapshot_observed_at":"2026-08-03T19:24:54.593615Z","submitted_at":"2025-01-12T15:21:22Z","title":"SPAM: Spike-Aware Adam with Momentum Reset for Stable LLM Training","version":2},"cited_work":{"arxiv_id":"2501.06842","doi":"10.48550/arxiv.2501.06842","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06842","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spam: Spike- aware adam with momentum reset for stable llm training.arXiv preprint arXiv:2501.06842","venue":"TU/e Research Portal","work_id":"a6e8de5a-448e-4f96-9f47-63cd6fbe7450","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2501.06842","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:ab3747ade45fc0060e03dffb1154b1f0937fa7568b98f6dceab94d8ab405ef59","observation_id":"88aff18f-3fb0-4d42-b513-6972e031ff0f","resolution":{"observed_at":"2026-05-18T10:02:31.706582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-04T04:17:53.148033Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":"1905.12322","doi":"10.48550/arxiv.1905.12322","metadata_source":"pith","pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Study of BFLOAT16 for Deep Learning Training","venue":"cs.LG","work_id":"5e0bebf8-8f7b-4b5d-afd7-8867758a6277","year":2019},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:ec84bb7257397151d2c0e97ed7deb5f0da542b76cb478a30f3573e3ab7a282ba","observation_id":"52e00fa9-ec25-4b75-8a7a-7be7ccc302f3","resolution":{"observed_at":"2026-05-18T10:02:31.738309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:68ba873917ffa784bf24ffb3f522837a79b55f2cc03031fa163b811ce7e30e17","observation_id":"53f66d0e-6c7b-41f6-96be-f52c7003805a","resolution":{"observed_at":"2026-05-18T10:02:31.756129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:7b4009ecc032b16e15cb8f4c769b47cf74856867a146e39ae1bf8dc921da95fc","observation_id":"0d9e66a6-2abb-4607-b5bf-4c19b90c21b2","resolution":{"observed_at":"2026-05-18T10:02:31.702310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12334","last_updated":"2019-05-29T11:25:09Z","snapshot_observed_at":"2026-07-06T07:56:22.526754Z","submitted_at":"2019-05-29T11:25:09Z","title":"Mixed Precision Training With 8-bit Floating Point","version":1},"cited_work":{"arxiv_id":"1905.12334","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.12334","snapshot_observed_at":"2026-07-02T06:06:41.652034Z","title":"Mixed Precision Training With 8-bit Floating Point","venue":"cs.LG","work_id":"01487127-b6f6-4500-9462-66ab5800b8fd","year":2019},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1905.12334","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:46c60c3d92a1b3e84ba7c050a989674e01557e814d159b3a0f46f42f4e592d1c","observation_id":"3e77396a-2006-4532-94df-1611f448be03","resolution":{"observed_at":"2026-05-18T10:02:31.684327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:19e264d0ad1cdb821ba4d8f51d9063bdfa2ffa3d654cdb3397990d170c0f32a2","observation_id":"7b607e40-1368-4393-880c-4fb464af087f","resolution":{"observed_at":"2026-05-18T10:02:31.654634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:2df308e9e1263b8844af7e9ea514e47bac667e500c15ded6afe438a2a3b8f91c","observation_id":"267a6714-9fda-4947-8fd6-a76fb131a427","resolution":{"observed_at":"2026-05-18T10:02:31.723095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:5ac48236469f0f378f3c27941b18cc309662fb671c17e84b81db5659ecd471f4","observation_id":"89f76f7b-7d55-4d47-bbd3-2d7e6cf46b53","resolution":{"observed_at":"2026-05-18T10:02:31.691756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"nanoGPT Issue","venue":null,"work_id":"e52160ac-0677-4617-8452-55cd01cec1f5","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:21cbcf7b6309c2499fc9175f666893026bdb285448f6f0ce88296df7bda06520","observation_id":"1e1dbe79-4ae7-41dc-939e-c2a6900e0c92","resolution":{"observed_at":"2026-05-18T10:02:31.803305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02915","last_updated":"2022-06-06T21:31:32Z","snapshot_observed_at":"2026-08-05T20:20:46.650120Z","submitted_at":"2022-06-06T21:31:32Z","title":"8-bit Numerical Formats for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"2206.02915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.02915","snapshot_observed_at":"2026-07-03T03:47:35.998768Z","title":"Badreddine Noune, Philip Jones, Daniel Justus, Dominic Masters, and Carlo Luschi","venue":null,"work_id":"1e2b4814-de0d-4c25-a0cd-d671fb337f4d","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2206.02915","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:ec2f9a4b3e67696c00313d738f1b1b5cd3ee26b7d0959eefa3b70108c8b58f24","observation_id":"93c4ca0f-0f0f-492e-9f4b-9839f0659c4e","resolution":{"observed_at":"2026-05-18T10:02:31.639481Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-07-06T16:39:36.790016Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.18313","doi":"10.48550/arxiv.2310.18313","metadata_source":"pith","pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FP8-LM: Training FP8 Large Language Models","venue":"cs.LG","work_id":"8aa8a89a-8428-4ed6-9efe-c9d583f852cf","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:18a1899c18063c4bf54232ef80b959c052b170e3867616dedd1561655d4cf069","observation_id":"65c71bf6-d9cd-4002-9fb2-6a0f447ec470","resolution":{"observed_at":"2026-05-18T10:02:31.727622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:31.760018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17224","last_updated":"2023-09-29T13:24:33Z","snapshot_observed_at":"2026-08-06T20:24:39.006099Z","submitted_at":"2023-09-29T13:24:33Z","title":"Training and inference of large language models using 8-bit floating point","version":1},"cited_work":{"arxiv_id":"2309.17224","doi":"10.48550/arxiv.2309.17224","metadata_source":"pith","pith_arxiv_id":"2309.17224","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training and inference of large lan- guage models using 8-bit floating point.arXiv preprint arXiv:2309.17224","venue":"cs.LG","work_id":"93af2807-3da0-479d-a9d7-67bc61639f22","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2309.17224","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:e096eccdb5d1afdd05a724154fbb89861932feaf6321b08992a802a608f48dcb","observation_id":"56d5338f-e883-4b21-a256-22388e7fa288","resolution":{"observed_at":"2026-05-18T10:02:31.696207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.299839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.299839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"cited_work":{"arxiv_id":"2505.06708","doi":"10.48550/arxiv.2505.06708","metadata_source":"pith","pith_arxiv_id":"2505.06708","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","venue":"cs.CL","work_id":"35cc586b-44f1-4948-a84b-866e8335e649","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.06708","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:421cc86408679be0a8c617b8474da6fe27d448e6dad51f66a6954d504e14c7c8","observation_id":"bf83668c-6f1c-4e1e-b0be-bd887d7e2282","resolution":{"observed_at":"2026-05-18T10:02:31.643403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:457264cac764a52cb2554977f8039b8055ef0bf58081f6a6f3cbcd902f522326","observation_id":"35f406cc-da44-44be-9695-590dda5c8203","resolution":{"observed_at":"2026-05-18T10:02:31.647731Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:140477c9f498748cad7874ea6dd8ee6fe9d18718d8436b68d66333a431a2b727","observation_id":"f223dff7-69e1-434c-8aa5-d4a7d67c0139","resolution":{"observed_at":"2026-05-18T10:02:31.746740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16682","last_updated":"2024-10-22T04:27:03Z","snapshot_observed_at":"2026-07-06T19:37:33.729773Z","submitted_at":"2024-10-22T04:27:03Z","title":"Methods of improving LLM training stability","version":1},"cited_work":{"arxiv_id":"2410.16682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16682","snapshot_observed_at":"2026-07-02T21:17:24.582185Z","title":"Methods of improving llm training stability.arXiv preprint arXiv:2410.16682","venue":null,"work_id":"6a681be8-dfbc-4350-a4d0-056b08871320","year":2024},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2410.16682","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:62b0898569c919bd8d651f0146665bae74f402d75e09e760926327a72ffc5dd3","observation_id":"22a56c48-f98b-43e8-84e5-c06205cf2fcc","resolution":{"observed_at":"2026-05-18T10:02:31.742547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:2b54738a6fc2748c510919d8948d4c2f622886f26f06726f13d1de799dc16445","observation_id":"ab409d59-1954-493a-bdfc-a17037221042","resolution":{"observed_at":"2026-05-18T10:02:31.651207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20586","last_updated":"2025-08-26T23:08:09Z","snapshot_observed_at":"2026-07-06T20:44:04.093457Z","submitted_at":"2025-02-27T23:01:31Z","title":"Training LLMs with MXFP4","version":3},"cited_work":{"arxiv_id":"2502.20586","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.20586","snapshot_observed_at":"2026-07-01T20:36:12.313960Z","title":"Training llms with mxfp4","venue":null,"work_id":"5311bef0-5858-4f57-9a9b-c9febbfff8b9","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2502.20586","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:d376e850647e437b7dcde90b6d0feccb77f7f56eadd21ed82d9d73713517a43c","observation_id":"0ee60707-4b4f-478a-ab91-f55567e38442","resolution":{"observed_at":"2026-05-18T10:02:31.760017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17116","last_updated":"2025-05-23T09:44:25Z","snapshot_observed_at":"2026-08-02T15:17:06.428629Z","submitted_at":"2025-01-28T18:04:50Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","version":2},"cited_work":{"arxiv_id":"2501.17116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.17116","snapshot_observed_at":"2026-07-03T07:27:44.449472Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","venue":"cs.LG","work_id":"dd7006b4-487d-4b92-9319-2fc36e31d954","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2501.17116","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:1e634f213c839b0472be71a387b5dbf1eb97c437ec210e48ed42cf490771ab7c","observation_id":"7eee6e6f-7efe-42c7-a26d-c059d5f17b33","resolution":{"observed_at":"2026-05-20T00:00:17.330307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitchell Wortsman, Tim Dettmers, Luke Zettlemoyer, Ari S","venue":null,"work_id":"f6a59a11-32e2-434a-8931-8388a39d65ab","year":2025},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:1aba9168b11b44af3d61f69b638bcd624033f645eda533f57ae51cf01df8d27a","observation_id":"8f603f96-661d-4b81-a8c9-86a00ab49069","resolution":{"observed_at":"2026-05-18T10:02:31.799841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:aed54cf8b58857310791d0774c2f83c71222cbad2d9029e56d9791db89a1bded","observation_id":"7b776de5-23a8-4a73-bd64-03fed27455ee","resolution":{"observed_at":"2026-05-18T10:02:31.687763Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03466","last_updated":"2022-03-28T08:12:14Z","snapshot_observed_at":"2026-08-03T21:15:21.591567Z","submitted_at":"2022-03-07T15:37:35Z","title":"Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer","version":2},"cited_work":{"arxiv_id":"2203.03466","doi":"10.48550/arxiv.2203.03466","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.03466","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tensor programs v: Tuning large neural networks via zero-shot hyperparameter transfer","venue":"arXiv (Cornell University)","work_id":"22ad4cec-5465-4cdb-a2aa-ace82b84b5e9","year":2022},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2203.03466","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:83c5f3d71ad7c76bae5004596231437132e39db41812bf185c37a78470b01a22","observation_id":"ab5518ee-fc94-4220-a46e-72af56d69016","resolution":{"observed_at":"2026-05-18T10:02:31.664367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":"2310.17813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-07-03T00:27:30.167566Z","title":"A spectral condition for feature learning","venue":null,"work_id":"ea5e7b7c-3b11-439d-8d99-51b97d507821","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:9c30834c9aa74f2dd361528d204467c141a18a1f311e2c614296b947a2242c5f","observation_id":"94f1e29d-3a57-407c-8f9e-e46d13956016","resolution":{"observed_at":"2026-05-18T10:02:31.669691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11458","last_updated":"2025-02-17T05:33:11Z","snapshot_observed_at":"2026-07-06T20:37:33.041473Z","submitted_at":"2025-02-17T05:33:11Z","title":"Towards Efficient Pre-training: Exploring FP4 Precision in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.11458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11458","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards efficient pre-training: Exploring fp4 precision in large language models.arXiv preprint arXiv:2502.11458","venue":null,"work_id":"2259d141-047b-4820-a5ad-8e92299e1390","year":null},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2502.11458","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:77c1418c26b56695f4a939f76d1edf8d500844d1b5dc3ca359b6e5316d28d97e","observation_id":"2afeead0-f78f-4c56-b46a-2fd1adf104bb","resolution":{"observed_at":"2026-05-18T10:02:31.635398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"gradient spikes","venue":null,"work_id":"ff41f005-1e39-46cc-83c6-9ac4e24bd9b9","year":2017},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:3b9111f938a23814f515c8fd310c9f340077628858fb33eb49c3ee0302aafa1a","observation_id":"7d863fef-6e0c-4126-91d7-be66321cb39a","resolution":{"observed_at":"2026-05-18T10:02:31.796249Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seg en Ã st 're ich s ho hem S oh ne / Un ser m Kaiser Ferdinand !","venue":null,"work_id":"902d1064-4a85-4b50-ad4d-df05465fed1d","year":2000},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:8a13928bba38dd52ef267216e06aae0f8cc0703cc878eb78f2f7b7a85ae6c7b1","observation_id":"a5f9a6f2-e73d-488c-b77f-1eed422f3313","resolution":{"observed_at":"2026-05-18T10:02:31.793196Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":2,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 5 inbound Pith citation observations for arXiv:2510.04212."}