{"as_of":"2026-08-11T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b125d2f81d4e22cd59c933e961abefee2274c8c508279cb107c2f0c11fe25339","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:12:47.881130Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:54:30.832174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:26:13.675967Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-04T14:51:29.915567Z","title":"Recipes for pre-training llms with mxfp8, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22536","last_updated":"2026-08-02T17:29:40Z","snapshot_observed_at":"2026-08-07T13:25:12.335817Z","submitted_at":"2025-09-26T16:16:49Z","title":"A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:51:29.915567Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2509.22536"},"observation_digest":"sha256:e61ff3f0d428a8be866ddb56b2cc3d672de161934231511e88eec47bc3c6c2be","observation_id":"d238393d-c84c-4717-8e97-4a6fc1071923","resolution":{"observed_at":"2026-08-04T14:51:29.915567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":"2506.08027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-07-01T20:26:13.675967Z","title":"Recipes for Pre-training LLMs with MXFP8, August 2025","venue":null,"work_id":"02351641-2a5b-4e7c-93d9-ff63875af49d","year":2025},"citing_paper":{"arxiv_id":"2512.02010","last_updated":"2026-05-09T05:39:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-01T18:59:45Z","title":"Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T02:23:01.845123Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2512.02010"},"observation_digest":"sha256:87f23244e24508059318d4f6084f2153519428e2052796a097c39cb1e78e5567","observation_id":"886ff8dc-5d2d-408b-bfc2-f9ebd0f55fcf","resolution":{"observed_at":"2026-05-17T02:23:52.769839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":"2506.08027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-07-01T20:26:13.675967Z","title":"Recipes for Pre-training LLMs with MXFP8, August 2025","venue":null,"work_id":"02351641-2a5b-4e7c-93d9-ff63875af49d","year":2025},"citing_paper":{"arxiv_id":"2604.15416","last_updated":"2026-04-16T17:55:36Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T17:55:36Z","title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T12:10:44.802059Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2604.15416"},"observation_digest":"sha256:6b72224b48702184a4328908dec04b5185138af4f86a36868bd6abe271d6e71f","observation_id":"5bc29d3f-438b-4a33-b922-6dfd36cb0907","resolution":{"observed_at":"2026-05-10T12:15:22.229993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":"2506.08027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-07-01T20:26:13.675967Z","title":"Recipes for Pre-training LLMs with MXFP8, August 2025","venue":null,"work_id":"02351641-2a5b-4e7c-93d9-ff63875af49d","year":2025},"citing_paper":{"arxiv_id":"2605.28691","last_updated":"2026-05-27T16:19:45Z","snapshot_observed_at":"2026-07-06T23:38:14.056361Z","submitted_at":"2026-05-27T16:19:45Z","title":"OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T13:06:02.201607Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2605.28691"},"observation_digest":"sha256:e923d993e522d8d09eec99d13b7ca12ec3ab10ddf0f6a13c7173867ae45008de","observation_id":"a50e61fd-5ca4-4c24-8e7c-b3e0301cdfbb","resolution":{"observed_at":"2026-06-29T13:13:27.553824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":"2506.08027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-07-01T20:26:13.675967Z","title":"Recipes for Pre-training LLMs with MXFP8, August 2025","venue":null,"work_id":"02351641-2a5b-4e7c-93d9-ff63875af49d","year":2025},"citing_paper":{"arxiv_id":"2606.00312","last_updated":"2026-05-29T19:36:08Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T19:36:08Z","title":"Stochastic Rounding Increases Small Singular Values","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T21:02:34.955394Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2606.00312"},"observation_digest":"sha256:79fb81527c59905f19039ae8740927c0b0794e80e99c242997cc5e64cec5fa46","observation_id":"81579add-036b-46f1-b340-2027e20a9d29","resolution":{"observed_at":"2026-07-01T20:26:13.679444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-02T06:45:18.277482Z","title":"Recipes for pre-training llms with mxfp8.arXiv preprint arXiv:2506.08027, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-06T06:09:03.498548Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:18.277482Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:bdb0e49cc1c6e92c25277516ae21ec1df862f318728c4bb0edaa51df78327660","observation_id":"cc3f4a9d-f5f0-4d3c-9c6d-a1906fda7d6a","resolution":{"observed_at":"2026-08-02T06:45:18.277482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-07-31T23:13:13.763909Z","title":"Recipes for pre-training LLMs with MXFP8.arXiv preprint arXiv:2506.08027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24062","last_updated":"2026-07-27T07:05:10Z","snapshot_observed_at":"2026-08-08T01:06:04.209315Z","submitted_at":"2026-07-27T07:05:10Z","title":"ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T23:13:13.763909Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2607.24062"},"observation_digest":"sha256:7c5d8ba75715264fb07221655e8cbd7b1c8b8e8077cf8e73d898838b2f8de7c6","observation_id":"35ce8b5d-d972-4296-9c31-5c3f40a2dbc8","resolution":{"observed_at":"2026-07-31T23:13:13.763909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-07-31T05:04:00.365982Z","title":"Recipes for pre-training llms with mxfp8.arXiv preprint arXiv:2506.08027, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24953","last_updated":"2026-07-27T18:03:34Z","snapshot_observed_at":"2026-08-08T09:25:33.697504Z","submitted_at":"2026-07-27T18:03:34Z","title":"Stable FP4 Training via Transposition-Invariant Block Quantization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T05:04:00.365982Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2607.24953"},"observation_digest":"sha256:24f7e2db24d1a9a6248c7a212d3ff6f5c9a7471f122341101c413a69bcb06cea","observation_id":"6bc22111-1ccd-450d-9be1-e93ba5b19779","resolution":{"observed_at":"2026-07-31T05:04:00.365982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-05T10:54:30.832174Z","title":"Recipes for pre- training llms with mxfp8,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03867","last_updated":"2026-08-04T16:08:20Z","snapshot_observed_at":"2026-08-10T16:07:24.405587Z","submitted_at":"2026-08-04T16:08:20Z","title":"Heterogeneity-Aware Microscaling for Efficient Low-Bit LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:54:30.832174Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2608.03867"},"observation_digest":"sha256:751d2f3b944eaf2b1779ce1bccdd84f920a22b497cc396c0c1d2991b3e4ba8e0","observation_id":"4524645d-eafa-4379-bd0b-c0b96d1facf0","resolution":{"observed_at":"2026-08-05T10:54:30.832174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08027/citation-record","integrity":"/paper/2506.08027/integrity","json":"/paper/2506.08027/citation-record.json","paper":"/paper/2506.08027"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.926849Z","title":"Ocp microscaling (mx) specification","venue":null,"work_id":"2900165c-9ac5-4080-b9e8-1c84a1dfd03c","year":2023},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:45.489420Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:97d420c8e9485f12f25ea86dcab6e802782effdf769ae8878d1a6e9f7de2a80b","observation_id":"e77c830a-1820-49fd-ae46-2e13d579e519","resolution":{"observed_at":"2026-08-07T12:12:49.996595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.773240Z","title":"URL https://resources.nvidia.com/ en-us-blackwell-architecture","venue":null,"work_id":"0a53614f-a2f2-430c-8450-14e9a390cd1e","year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:45.576876Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:8168e992197f79163c06614a40ea6141595c56c638c92c766f196e2d57d13ef5","observation_id":"d2778806-4b3d-4b72-8898-02fb0cef4683","resolution":{"observed_at":"2026-08-07T12:12:49.848468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-08T01:04:32.134805Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-07T12:12:45.790981Z","title":"Microscaling data formats for deep learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:45.790981Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:7ee89f7630c410782b1f03395aaa6615d5833ab43d8902c73e3767fbde378a0a","observation_id":"ea954705-fd04-42aa-92d2-feba37489914","resolution":{"observed_at":"2026-08-07T12:12:45.790981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08007","last_updated":"2023-04-13T02:31:29Z","snapshot_observed_at":"2026-08-09T19:23:26.806310Z","submitted_at":"2023-02-16T00:37:55Z","title":"With Shared Microexponents, A Little Shifting Goes a Long Way","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08007","snapshot_observed_at":"2026-08-07T12:12:46.032229Z","title":"With shared microexpo- nents, a little shifting goes a long way, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.032229Z"},"links":{"cited_paper":"/paper/2302.08007","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:192d183a255701644a0d0595bc169a80765551cf4a258136caac54706369b7ed","observation_id":"c91acf53-9320-43cb-890b-4de84268977c","resolution":{"observed_at":"2026-08-07T12:12:46.032229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04503","last_updated":"2021-02-08T19:56:04Z","snapshot_observed_at":"2026-08-07T06:30:07.035461Z","submitted_at":"2021-02-08T19:56:04Z","title":"VS-Quant: Per-vector Scaled Quantization for Accurate Low-Precision Neural Network Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.04503","snapshot_observed_at":"2026-08-07T12:12:46.101980Z","title":"Dally, and Brucek Khailany","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.101980Z"},"links":{"cited_paper":"/paper/2102.04503","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:454e2b59aa641f7e2e7e0f8f4f9384b2c3cae815d0b2f142153d9f9f93e02635","observation_id":"978acedf-b124-4ddd-9747-37dc484cf5b0","resolution":{"observed_at":"2026-08-07T12:12:46.101980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2008.46109","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:48.520986Z","title":"IEEE Std 754-2008 , pages 1–70, 2008","venue":null,"work_id":"41fdd7a0-86c2-4bf4-ae79-e21522a34d8b","year":2008},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.111933Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:c0da8be5a02c7504d21baee43274f46bd6b8951f322dab8a3591195e9ff09dfb","observation_id":"5004dd90-74fe-4df4-9bd4-241d6565ebf4","resolution":{"observed_at":"2026-08-07T12:12:48.576575Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-10T16:19:00.326414Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-07T12:12:46.118074Z","title":"Fp8 formats for deep learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.118074Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:79e900041c2e2ad385b406f954b6f7f4e74ff90e6c7e0e91210fe7fd6a5b6ab0","observation_id":"97beda48-3844-43fc-b362-5c5cab22791b","resolution":{"observed_at":"2026-08-07T12:12:46.118074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16819","last_updated":"2024-02-27T15:22:57Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:43:45Z","title":"Nemotron-4 15B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16819","snapshot_observed_at":"2026-08-07T12:12:46.131912Z","title":"Nemotron-4 15b technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.131912Z"},"links":{"cited_paper":"/paper/2402.16819","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:8c7d50c0720927e3d39eae136e51975b24470e4b83f05c4c634ce1b82c9fb2cc","observation_id":"f0aed45f-126b-44e2-9d42-acb6f5b6ea54","resolution":{"observed_at":"2026-08-07T12:12:46.131912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-09T11:20:42.068658Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-07T12:12:46.195871Z","title":"Nemotron-h: A family of accurate and efficient hybrid mamba-transformer models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.195871Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:4b2867f48cca54802470a48e6d2fef03dcd1463b4a40f9a0031a4ac0e08717ec","observation_id":"b5193df3-7e9b-400a-9b83-9666c5fe7341","resolution":{"observed_at":"2026-08-07T12:12:46.195871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T12:12:46.269897Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.269897Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:0de9a87bcaabb03eec21b02a36a477b9331d65ec7ad7f8766571ee13d946ae8c","observation_id":"c911db37-3acf-4e46-ad04-4fe11bdbcc4d","resolution":{"observed_at":"2026-08-07T12:12:46.269897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:12:46.342345Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.342345Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:e404987c2ba6a2ded63410ad72fe0d65e28714ee268e87af6ca67883609c1a44","observation_id":"13320e44-8583-430e-80bf-3fb3072fbb25","resolution":{"observed_at":"2026-08-07T12:12:46.342345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:12:46.423646Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.423646Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:4b1cdc5d8a5ee194b9652233993467e942a10365b1d017cc7f2135b2916fba0b","observation_id":"d51b2a97-8a5a-4e00-acf8-e89e75597ef9","resolution":{"observed_at":"2026-08-07T12:12:46.423646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-07T12:12:46.493873Z","title":"Race: Large-scale reading comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.493873Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:ed8795f2c8875d5fb4e83bce1477e68dcac14d79cda70c7fa4cefdf77fb7d7bf","observation_id":"aa12abb8-26b2-4213-9838-7d379e44d8e6","resolution":{"observed_at":"2026-08-07T12:12:46.493873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T12:12:46.582966Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.582966Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:d6007053310e4db8598cb9fdafeb564b1e4843368bb5dadda50e1d271a745875","observation_id":"eb1c1a33-5e07-4ef4-b502-57f205bd6a5f","resolution":{"observed_at":"2026-08-07T12:12:46.582966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:46.617897Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.617897Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:840f5b35bd557f914387a1486680376dcddd33df49a23b7401dc48ded700629c","observation_id":"576341e0-8c74-421d-84d1-797c1d9cb0b9","resolution":{"observed_at":"2026-08-07T12:12:46.617897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T12:12:46.646932Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.646932Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:1ad601c4b39b2be44db4b6892465110c851b95c21b5fd228861cbf036a3e7ff6","observation_id":"ac0d46a1-cc6d-418c-a915-b00240ae8c9c","resolution":{"observed_at":"2026-08-07T12:12:46.646932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T12:12:46.664591Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.664591Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:922deb236edb27253c1cfd9a957acb6e06985a903c0d758418643d830babe80c","observation_id":"8158c597-b84e-42aa-b16f-721c584852f3","resolution":{"observed_at":"2026-08-07T12:12:46.664591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.648927Z","title":"Socialiqa: Com- monsense reasoning about social interactions, 2019","venue":null,"work_id":"03dfe50c-b03f-4a12-9d3d-6fc67f95d03e","year":2019},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.684428Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:70d33271ebee54ff62381311c140126bbe2879a4ba98a92cb5ad5333256027e7","observation_id":"47481e3d-4ead-439e-b2a9-1a932ff3223a","resolution":{"observed_at":"2026-08-07T12:12:49.697169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:46.703553Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.703553Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:6bf08302aaddf92145b3f6d104c7119028163ff8938e60c7545c2480c1e9449f","observation_id":"27417057-aa1c-4011-b874-ef31b5cef6b2","resolution":{"observed_at":"2026-08-07T12:12:46.703553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:12:46.730511Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.730511Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:4a1486238aff2a7b5365b3781873180d1fc8162b1a8c57e3361c100294005355","observation_id":"4324b597-0cae-48ec-97f6-5ad225c24c3c","resolution":{"observed_at":"2026-08-07T12:12:46.730511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.516426Z","title":"8-bit numerical formats for deep neural networks, 2022","venue":null,"work_id":"690d310b-96de-4618-86ad-73d4b38d03cb","year":2022},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.736164Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:8a1d18cbab29a87ab53975b5edcadc1bbe5e40ed9c715a0c5f65b2a8c57a1e25","observation_id":"8c86409a-67f0-46ea-a62c-353d2b508dcc","resolution":{"observed_at":"2026-08-07T12:12:49.576743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:46.754388Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.754388Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:eb7c155ea8b7c9dadbcbb4f4ea1557eb2f949b1bc378d91e7f5b7e25797ab5c3","observation_id":"c7d49f70-6b50-4e37-9bf3-15da04787a62","resolution":{"observed_at":"2026-08-07T12:12:46.754388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.339466Z","title":"Ocp 8-bit floating point specification (ofp8)","venue":null,"work_id":"0de53ff7-049a-4c58-bcbf-b1e42e5aedbf","year":2023},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.890232Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:ff3f8ca6e21e25b2b7b229bc97f8e99dab76cb15598abae11589f3e792ba35a3","observation_id":"8abe41fd-7c90-4bf4-af27-f82a37759078","resolution":{"observed_at":"2026-08-07T12:12:49.395984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.205229Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"0a99e41f-f767-456f-983b-8493e963f562","year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.946348Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:7bae5e1cadd15e21e267df8393552bb611fa40f407411bcf34181ae37bdee80d","observation_id":"073bdb9f-4131-4710-9eb0-861788e9ff79","resolution":{"observed_at":"2026-08-07T12:12:49.253153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-11T03:12:32.404394Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-07T12:12:47.074402Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.074402Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:943f5a36125d06ac6b91c9dd7f428696fce9ffcc8bdd9a4d571965f0dae5368f","observation_id":"97cacf03-4797-4ebe-bce0-b18e0910712d","resolution":{"observed_at":"2026-08-07T12:12:47.074402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-07T12:12:47.159556Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.159556Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:383fa82946da4f0e4634d01550a96257fb62d2a3f0de4ea8f068dbe328b23519","observation_id":"28f760c5-22f8-4eb8-bbd2-b581dedb1e4c","resolution":{"observed_at":"2026-08-07T12:12:47.159556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-07T12:12:47.221979Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.221979Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:2e590f638d0def70f1bcecf8431feb4b9d6ccc4958fd256f03349b29b69a1c38","observation_id":"5a0ae3d2-6aab-4a30-8b62-7852f67537a9","resolution":{"observed_at":"2026-08-07T12:12:47.221979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-07T19:54:09.137276Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-07T12:12:47.282884Z","title":"Scaling fp8 training to trillion-token llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.282884Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:847e8d9f6752003df9a5b5275c19fef1edd5cdf66f6615aedc54fd480680f4e8","observation_id":"6873f7de-f463-4129-8d2a-ad77c575243b","resolution":{"observed_at":"2026-08-07T12:12:47.282884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:49.072117Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innova- tion","venue":null,"work_id":"5e885569-d266-4fcf-a686-347f123d02bf","year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.338504Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:b21e25665ee8a0116f36e9788c8c2e3b6244f57f8cd792729fdef73159c03d1b","observation_id":"b808aec9-2b83-4fe6-b3cd-43066f20400f","resolution":{"observed_at":"2026-08-07T12:12:49.124436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20586","last_updated":"2025-08-26T23:08:09Z","snapshot_observed_at":"2026-08-10T16:31:28.471977Z","submitted_at":"2025-02-27T23:01:31Z","title":"Training LLMs with MXFP4","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20586","snapshot_observed_at":"2026-08-07T12:12:47.436064Z","title":"Training llms with mxfp4, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.436064Z"},"links":{"cited_paper":"/paper/2502.20586","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:220925d5745100a564efea89bd6cdbdfaf1add3654d16e71e600740950ba0f29","observation_id":"2ad6dd0c-2c4d-450a-8a9c-19ee36aabc99","resolution":{"observed_at":"2026-08-07T12:12:47.436064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17116","last_updated":"2025-05-23T09:44:25Z","snapshot_observed_at":"2026-08-02T15:17:06.428629Z","submitted_at":"2025-01-28T18:04:50Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17116","snapshot_observed_at":"2026-08-07T12:12:47.457958Z","title":"Optimizing large language model training using fp4 quantization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.457958Z"},"links":{"cited_paper":"/paper/2501.17116","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:1447cb10b81cd66c9980fcf151b7d54acf1f9bd26eb34dc16df48fa37cf376e1","observation_id":"faf32e08-be52-45c7-a1cb-f11c842a2909","resolution":{"observed_at":"2026-08-07T12:12:47.457958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:48.958272Z","title":"Transformer engine","venue":null,"work_id":"dfbb83ca-a222-4511-bb6b-b23b1b0d5a36","year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.463802Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:d95b2c774376a380a1281499888c2b94273d2746fcf977bc6f8b48b6e101546b","observation_id":"40625447-23d6-4b9f-b3ca-81594a08b54c","resolution":{"observed_at":"2026-08-07T12:12:48.996727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:12:47.507189Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.507189Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:ef6430f14aae8eabbc629ccf0bb576ad9c594df098a609a409b15dbcd6dde98f","observation_id":"0f338323-0bc3-41c1-b8b8-2a77fa8253e5","resolution":{"observed_at":"2026-08-07T12:12:47.507189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-07T12:12:47.569722Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.569722Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:c88a500d8b8ae9d71aa37af04a959a6508133099adc11223c8fcad12d741e8cb","observation_id":"cefd3c8d-4ce7-45c9-99ff-acb5919ea260","resolution":{"observed_at":"2026-08-07T12:12:47.569722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-10T10:05:36.769699Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-07T12:12:47.627819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.627819Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:4174f9d1e2a9720bbf18e0528dd427f49e6906ad12aefb8d1106df3ddbf181f3","observation_id":"caef3419-ee7f-44e3-ac4c-c9d34222be05","resolution":{"observed_at":"2026-08-07T12:12:47.627819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:48.851927Z","title":null,"venue":null,"work_id":"20055b05-2393-4966-94cb-8b06b9067c21","year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.734191Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:986d265ef1311e125a7cb0ada485e7ff88073895c9b8bea2e1ef405adedda67f","observation_id":"be684594-0e13-4231-98fc-0ab4833e81eb","resolution":{"observed_at":"2026-08-07T12:12:48.896269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:48.750531Z","title":null,"venue":null,"work_id":"9acf6839-45aa-4dbd-a8b4-2d4104dd3a18","year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.807734Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:36c91578cf4262f375b622854f22a4444571168e5328429694e90a40e7a858bb","observation_id":"802c0213-cdba-4429-bcf3-8cbef9468f7f","resolution":{"observed_at":"2026-08-07T12:12:48.785664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:12:48.668934Z","title":"By construction amax/destmax never exceeds 2127 (which is the largest value representable in UE8M0) with FP8, FP6 or FP4 formats","venue":null,"work_id":"d09aeafe-5cdd-4182-9b07-7d9161f761f5","year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.881130Z"},"links":{"citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:ee8f0d8a84d2dfa1a4dd8dbcc6b53f7e0da9eeed2cb46f839c50a31542d01f28","observation_id":"91e9d15e-83dd-480e-89f7-a4fca49d9d1b","resolution":{"observed_at":"2026-08-07T12:12:48.698298Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-07T09:04:32.994880Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-07T12:12:47.016932Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:47.016932Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:3c8dd91b16c5717f71a7171b94c49b58bfdc6e2e776ee8708bce5414910d7256","observation_id":"ff2704d2-c5dc-4343-a25d-6be97f90f558","resolution":{"observed_at":"2026-08-07T12:12:47.016932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:12:46.816128Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:46.816128Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.08027"},"observation_digest":"sha256:f786ea5ac5d4ad70ca2e9094fb07ae8c7df7b2662a6232d67c34f5d09f62dcc4","observation_id":"80d5696e-8679-4c52-a166-52d569aefcda","resolution":{"observed_at":"2026-08-07T12:12:46.816128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:33:39.206845Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 9 inbound Pith citation observations for arXiv:2506.08027."}