{"as_of":"2026-08-09T16:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ee8b4e2a5ddf92ef27f1e94234e302d63e59c68c9302730bff3122dc9e2b83f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:37:23.812206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:27:30.162768Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T07:27:52.883335Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2409.20325"},"observation_digest":"sha256:a948b39e81c0d2361fdbc4cf2bc539a244bbaa4c5d34dc6411cbce006ea1a389","observation_id":"d37440de-1ffc-48ba-8fb9-af58f132c7e8","resolution":{"observed_at":"2026-05-16T07:27:52.955453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-08T14:37:23.812206Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-09T03:57:33.421199Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.812206Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:86d589eafcceb3bb50867f6ce1b45d4f9eb5c36d5b7f5bcfadd3ddf139baaea6","observation_id":"552f658d-4508-401a-9dea-25d0d0515d53","resolution":{"observed_at":"2026-08-08T14:37:23.812206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-08T11:35:29.795327Z","title":"Decon- structing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07923","last_updated":"2025-05-27T15:31:20Z","snapshot_observed_at":"2026-08-08T23:26:23.316471Z","submitted_at":"2025-02-11T19:54:11Z","title":"Sign Operator for Coping with Heavy-Tailed Noise in Non-Convex Optimization: High Probability Bounds Under $(L_0, L_1)$-Smoothness","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T11:35:29.795327Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2502.07923"},"observation_digest":"sha256:48b77a282f67ddb5219b6226f39030061df11d40d63fbb2ac49f6b6fb9065146","observation_id":"c06a0683-cccb-4e75-8f15-627151518656","resolution":{"observed_at":"2026-08-08T11:35:29.795327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-08T05:12:33.621237Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08441","last_updated":"2025-08-01T15:28:51Z","snapshot_observed_at":"2026-08-09T12:25:13.009135Z","submitted_at":"2025-02-12T14:32:17Z","title":"Better Embeddings with Coupled Adam","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T05:12:33.621237Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2502.08441"},"observation_digest":"sha256:fd423cd6b95cfa9bae6b094554ebce21a47ef1eebab5d7014da4f122b5865525","observation_id":"0b7b1c12-83bc-45c6-834c-061fb5332e91","resolution":{"observed_at":"2026-08-08T05:12:33.621237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T11:57:29.263146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01049","last_updated":"2025-06-01T15:30:37Z","snapshot_observed_at":"2026-08-09T06:54:42.859556Z","submitted_at":"2025-06-01T15:30:37Z","title":"Taming LLMs by Scaling Learning Rates with Gradient Grouping","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:29.263146Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.01049"},"observation_digest":"sha256:bd465fdead2da0f54df27bae0bae395cb8fcb8c8a11a2de6b33dbe7a7de7131e","observation_id":"b19eaa3e-d997-4475-af1e-df2e6a124e0c","resolution":{"observed_at":"2026-08-07T11:57:29.263146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-07T00:50:30.636520Z","title":"arXiv:2407.07972 [cs]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12543","last_updated":"2025-06-14T15:37:31Z","snapshot_observed_at":"2026-08-08T23:08:34.335687Z","submitted_at":"2025-06-14T15:37:31Z","title":"Is your batch size the problem? Revisiting the Adam-SGD gap in language modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:30.636520Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2506.12543"},"observation_digest":"sha256:2d350675019d0b3cccecbc17e7ec15407e08f106bb447e3e99d26925ee6b5eca","observation_id":"d6d36155-b1fa-4519-8f90-785c1d93fa03","resolution":{"observed_at":"2026-08-07T00:50:30.636520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-06T21:09:33.200101Z","title":"steady state","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01129","last_updated":"2025-07-01T18:44:35Z","snapshot_observed_at":"2026-08-09T07:57:08.844393Z","submitted_at":"2025-07-01T18:44:35Z","title":"On Design Principles for Private Adaptive Optimizers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:09:33.200101Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2507.01129"},"observation_digest":"sha256:2d747647ec392f6d296da8017138ec75711c4eada5b035e862ac4df67a2671b0","observation_id":"d12a81c7-2229-430d-9787-4b99a6c15a39","resolution":{"observed_at":"2026-08-06T21:09:33.200101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-04T09:38:51.648559Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.14717","last_updated":"2026-07-27T17:12:10Z","snapshot_observed_at":"2026-08-07T22:51:49.378334Z","submitted_at":"2025-10-16T14:17:38Z","title":"Seesaw: Accelerating Training by Balancing Learning Rate and Batch Size Scheduling","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T09:38:51.648559Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2510.14717"},"observation_digest":"sha256:3db707ae290379aca6b8e118a662cae35bf7b3c98a1c91cd4cb4df2648745a8c","observation_id":"7ea7beba-0650-4b10-aaf8-17de7a19d88a","resolution":{"observed_at":"2026-08-04T09:38:51.648559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-03T00:02:46.444321Z","title":"Deconstruct- ing what makes a good optimizer for language models.arXiv preprint arXiv:2407.07972,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.444321Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:64da1978bad59d041ed9301c98c75aa2c6d706ccb2ae18825b468198b5eee5ad","observation_id":"e2572600-d266-46aa-9b73-c18d7d38e2fe","resolution":{"observed_at":"2026-08-03T00:02:46.444321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:e2faa25543a25a7369e27ddb27de26622a8ae1a34ab698477e407c9fe7ca4134","observation_id":"d38d8f07-0ca0-46f3-863d-c89996a5d9e8","resolution":{"observed_at":"2026-07-02T07:06:44.884155Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-02T08:47:15.917924Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:0efe300746f0221921e48859a8ad6ca3e1f7c5bf2a94dbad1c3bb0133e5ca524","observation_id":"d6158db1-28c9-472b-918e-6470b164ddee","resolution":{"observed_at":"2026-07-02T11:56:56.098113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":"2407.07972","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-03T00:27:30.162768Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":"3c4f8138-ef86-4747-a656-4009073d20ee","year":2024},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:2a7b964c294aea1da1db6143c738dbd293da08eea333ae2982f4e7a665d82d0d","observation_id":"ac0f7cd7-60a2-45d1-a928-e2242878a79c","resolution":{"observed_at":"2026-07-03T00:27:30.164103Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Deconstructing what makes a good optimizer for language models, 2025.URL https://arxiv","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:e56d107c189d32091956b158f581dd827ca8417bac5bd9c86eb3c3f3bbbd93a2","observation_id":"c531ab18-8baf-4ef5-a237-ab573d950f87","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-05T05:27:16.990675Z","title":"Deconstructing what makes a good optimizer for language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03941","last_updated":"2026-08-04T17:10:47Z","snapshot_observed_at":"2026-08-09T03:11:52.905541Z","submitted_at":"2026-08-04T17:10:47Z","title":"Muon Meets Mamba: Spectral Optimization for State Space Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T05:27:16.990675Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2608.03941"},"observation_digest":"sha256:5b4547d0cdb45f169b7cce74a42ae2215996bf21325aa9481655af38bc6b58e1","observation_id":"4e96dacf-3e2f-44a5-9d04-d6acdee852fa","resolution":{"observed_at":"2026-08-05T05:27:16.990675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.07972/citation-record","integrity":"/paper/2407.07972/integrity","json":"/paper/2407.07972/citation-record.json","paper":"/paper/2407.07972"},"outbound":[],"paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:26:09.153970Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2407.07972."}