{"as_of":"2026-08-07T08:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9517ad6dff0993c045cd613d73123c3e30a66831465645a92693e4c4f7faf8a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:20:55.154469Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:58:46.561911Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T12:01:51.366667Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2412.20404"},"observation_digest":"sha256:0610536d7af61a16a4682bfd7df202c5df0ebb8b01313d64ea6b1ff6186c9456","observation_id":"7a33ac89-6c24-41ec-966f-92f9ae595e57","resolution":{"observed_at":"2026-05-11T12:01:51.910253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:16894336df9acedaa5a8a2f6c23151b0e10f8442bc16fd544c6c65a892cff09c","observation_id":"727a2f04-a0a2-4150-817c-55135e9601ad","resolution":{"observed_at":"2026-05-23T05:57:36.571046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:458ae754d7ee5863869a41930c2e46f164b87dd9a4a57918f4d1ed454a038f70","observation_id":"5e355aed-54ed-489a-b66e-e6d8bbc94de5","resolution":{"observed_at":"2026-05-10T16:23:42.174655Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T09:28:16.189617Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2506.13585"},"observation_digest":"sha256:e518eae7ed3bc1acaf97c9d927ebf225e87c74b6b7c94b86470e031f49020003","observation_id":"65ff9138-aa07-45f5-819a-2f8d2b8f82d2","resolution":{"observed_at":"2026-05-12T09:28:16.436746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-06T19:20:55.154469Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05934","last_updated":"2025-07-08T12:34:10Z","snapshot_observed_at":"2026-08-06T19:12:22.082286Z","submitted_at":"2025-07-08T12:34:10Z","title":"BlueLM-2.5-3B Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:20:55.154469Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2507.05934"},"observation_digest":"sha256:9e2aa9c311f7637cc235451d083a1807264c7ad058a537c9c21d3af4912fefa4","observation_id":"4498765b-e928-47da-a0e9-0a7f9298dfba","resolution":{"observed_at":"2026-08-06T19:20:55.154469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-19T05:48:02.828938Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2507.06261"},"observation_digest":"sha256:e563c9184adcbc5f2208f6f1e4affc3c509a8e721ff6e91c5a69fdaf84f378d1","observation_id":"1cce8f6d-0731-434a-8d6e-ad40ad447574","resolution":{"observed_at":"2026-05-19T05:52:07.741814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-06T19:10:16.570768Z","title":"A theory on adam insta- bility in large-scale machine learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06464","last_updated":"2025-07-09T00:47:37Z","snapshot_observed_at":"2026-08-07T07:16:30.434582Z","submitted_at":"2025-07-09T00:47:37Z","title":"SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:16.570768Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2507.06464"},"observation_digest":"sha256:4d0eb4ab7e82b433685f90e69b8e662005a047ca0aa299b3aba67431dfb25e5b","observation_id":"6c436ba2-b562-42f2-af4e-208e2df607d3","resolution":{"observed_at":"2026-08-06T19:10:16.570768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:d761a4224cb089b3f89074ea93e78400c8e76b95fbd5fa53ed935431993eb495","observation_id":"89f76f7b-7d55-4d47-bbd3-2d7e6cf46b53","resolution":{"observed_at":"2026-05-18T10:02:31.691756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-04T09:54:26.229865Z","title":"A theory on adam instability in large- scale machine learning.arXiv preprint arXiv:2304.09871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.12784","last_updated":"2026-06-28T11:09:54Z","snapshot_observed_at":"2026-08-04T09:54:23.338683Z","submitted_at":"2025-10-14T17:56:11Z","title":"SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:26.229865Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2510.12784"},"observation_digest":"sha256:e1dbb9bda411307b306ebb8a3d67f7fcce8ce60e2e24dcecd4c87981adad1361","observation_id":"69d936c1-0a4b-4c8d-a1ed-c26e1e006dbd","resolution":{"observed_at":"2026-08-04T09:54:26.229865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.06152","last_updated":"2026-05-26T10:55:47Z","snapshot_observed_at":"2026-08-05T13:28:17.380652Z","submitted_at":"2026-05-07T12:45:21Z","title":"Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T13:40:34.426011Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.06152"},"observation_digest":"sha256:69ce390e6e687db4ab0b9dc3ec194b86492d672a97ea967fae782203ce0ffc78","observation_id":"0010ad04-dffd-4a2e-9e32-734603c76f76","resolution":{"observed_at":"2026-05-11T18:51:07.706844Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.06152","last_updated":"2026-05-26T10:55:47Z","snapshot_observed_at":"2026-08-05T13:28:17.380652Z","submitted_at":"2026-05-07T12:45:21Z","title":"Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:11:04.242477Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.06152"},"observation_digest":"sha256:b194178286ec221419eb3197bee22a6c85eaf9738027607721daf91d874abf3c","observation_id":"e7a1767b-089d-41a6-a40e-94209f7887dd","resolution":{"observed_at":"2026-05-13T07:12:27.956242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.06152","last_updated":"2026-05-26T10:55:47Z","snapshot_observed_at":"2026-08-05T13:28:17.380652Z","submitted_at":"2026-05-07T12:45:21Z","title":"Grokking or Glitching? How Low-Precision Drives Slingshot Loss Spikes","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:33:31.271082Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.06152"},"observation_digest":"sha256:d810cf7b1991edf95a7081f9ebee1dd4786e615990635e07e03b49e7641f419d","observation_id":"a0839373-1ea1-4b56-a250-ec18a8ab4ae6","resolution":{"observed_at":"2026-06-30T23:35:07.177922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.09176","last_updated":"2026-05-09T21:34:28Z","snapshot_observed_at":"2026-08-07T08:11:50.660698Z","submitted_at":"2026-05-09T21:34:28Z","title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:32.057022Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.09176"},"observation_digest":"sha256:5196a5fbafccdae052275b51798f23f22ea094f6720253bcd7618db0e3977bf0","observation_id":"f05c12b8-8e3f-4fd5-9ca6-6aad744bc447","resolution":{"observed_at":"2026-05-12T06:41:45.364071Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2605.25704","last_updated":"2026-05-25T11:02:05Z","snapshot_observed_at":"2026-08-06T10:25:26.859166Z","submitted_at":"2026-05-25T11:02:05Z","title":"PowLU: An Activation Function for Stable Pre-Training of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T21:48:45.339523Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2605.25704"},"observation_digest":"sha256:5652205868b12a68c75c52ed1ace0e7be829008cba539c068822c8baeb88b098","observation_id":"c2fef1fe-201a-4872-9993-551dc61a4c9c","resolution":{"observed_at":"2026-06-29T21:53:59.472017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":"2304.09871","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-07-03T17:58:46.561911Z","title":"Molybog, P","venue":null,"work_id":"3eb50cd8-c781-4c60-bee1-e598dbed9106","year":2023},"citing_paper":{"arxiv_id":"2607.01678","last_updated":"2026-07-02T04:10:42Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:10:42Z","title":"SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-03T17:56:52.510949Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2607.01678"},"observation_digest":"sha256:8ed780c30fc692f8d37cc3ceb23ef965bac84e8fa97ce087e10c28e5119d6203","observation_id":"1f6851aa-1254-4e80-86e8-65ba957d359c","resolution":{"observed_at":"2026-07-03T17:58:46.564385Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-01T08:50:45.390519Z","title":"arXiv preprint arXiv:2304.09871 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21005","last_updated":"2026-07-23T07:39:03Z","snapshot_observed_at":"2026-08-06T16:38:33.932762Z","submitted_at":"2026-07-23T07:39:03Z","title":"Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T08:50:45.390519Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2607.21005"},"observation_digest":"sha256:0b73ac6d24b7cde47dec4cd491897be25e92d57d8fbc08a218dcfff0de61b0f3","observation_id":"2279d5e6-0658-4bb4-80f7-9d0c7e81dbb5","resolution":{"observed_at":"2026-08-01T08:50:45.390519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09871","snapshot_observed_at":"2026-08-04T15:20:16.153293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02091","last_updated":"2026-08-03T11:50:06Z","snapshot_observed_at":"2026-08-07T07:17:17.881135Z","submitted_at":"2026-08-03T11:50:06Z","title":"One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T15:20:16.153293Z"},"links":{"cited_paper":"/paper/2304.09871","citing_paper":"/paper/2608.02091"},"observation_digest":"sha256:bb7bd95dffda364c594b8a7aa9b6ad58274ab894889d63f1e1a9f0b0a53d7aa7","observation_id":"a88a8d50-ca31-4335-b80d-d67f365b3321","resolution":{"observed_at":"2026-08-04T15:20:16.153293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.09871/citation-record","integrity":"/paper/2304.09871/integrity","json":"/paper/2304.09871/citation-record.json","paper":"/paper/2304.09871"},"outbound":[],"paper":{"arxiv_id":"2304.09871","last_updated":"2023-04-25T04:48:47Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T21:16:54.439908Z","submitted_at":"2023-04-19T06:15:11Z","title":"A Theory on Adam Instability in Large-Scale Machine Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2304.09871."}