{"as_of":"2026-08-15T11:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b233995ce805749cff355fe595264a6c8f4104a40493ce2428f3aec1e4f8cd9","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:52:40.239399Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.17866/citation-record","integrity":"/paper/2411.17866/integrity","json":"/paper/2411.17866/citation-record.json","paper":"/paper/2411.17866"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.371796Z","title":"B.2 Proof of Theorem 2 Proof","venue":null,"work_id":"544d3031-51f6-49de-a8d0-1341a3c6bd35","year":2019},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.232476Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:d67cba41d7fbda82b3685fc1d855157a2bd83451525f62db144b2879fe3ea277","observation_id":"6d0e721a-bb86-4806-ac83-b4fdceb0a6ad","resolution":{"observed_at":"2026-08-12T11:52:40.375344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-12T11:52:40.189105Z","title":"Marina: Faster non-convex distributed learning with compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.189105Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:1a6ad7c9ebd6470dec498cf74e1399feea5dd95993aed771a0d59b5b7c6d02b8","observation_id":"61450cc5-0962-48bd-aedd-0fe47d821e58","resolution":{"observed_at":"2026-08-12T11:52:40.189105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00438","last_updated":"2024-03-30T18:07:29Z","snapshot_observed_at":"2026-08-13T00:40:51.168283Z","submitted_at":"2024-03-30T18:07:29Z","title":"Communication Efficient Distributed Training with Distributed Lion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00438","snapshot_observed_at":"2026-08-12T11:52:40.204858Z","title":"Communication efficient distributed training with distributed lion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.204858Z"},"links":{"cited_paper":"/paper/2404.00438","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:4626d427cbd9b45775c3369992ce651430274e2ac78f1f87f2f90f782bf0a310","observation_id":"7ae358af-52de-437b-9dc2-89549154bf32","resolution":{"observed_at":"2026-08-12T11:52:40.204858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-12T11:52:40.208306Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.208306Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:d9ca01334d9625846454eb2b7e87b063cce6103e4c789298f62eaab8d2e57163","observation_id":"24c53192-5b69-43ee-8f93-0e148fb7d541","resolution":{"observed_at":"2026-08-12T11:52:40.208306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00643","last_updated":"2020-02-19T20:00:02Z","snapshot_observed_at":"2026-08-11T15:09:30.727773Z","submitted_at":"2019-10-01T20:06:48Z","title":"SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00643","snapshot_observed_at":"2026-08-12T11:52:40.224459Z","title":"Slowmo: Improving communication- efficient distributed sgd with slow momentum","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.224459Z"},"links":{"cited_paper":"/paper/1910.00643","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:3e4cfd37f4840e1f520eededfb23ea1673c22849cc1103f3d03b4a6248a2b202","observation_id":"2dc2c6f2-8bac-4c4c-bd29-18cd79a5b4c9","resolution":{"observed_at":"2026-08-12T11:52:40.224459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.382608Z","title":"Component-wise vector multi- plication g2 t = gt ⊙gt, and √bvt means component- wise square root","venue":null,"work_id":"fb0fcfaa-b97c-479c-93ad-cbce77aa9315","year":2017},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.228224Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:c48c7243ca742fab29d99e1a5a7471ed1baded1a1019314d4a189698728944f8","observation_id":"d93a4334-a18f-4903-913c-b78584af68dd","resolution":{"observed_at":"2026-08-12T11:52:40.387240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.361264Z","title":"(38) Proof","venue":null,"work_id":"efaca30f-9c8d-4fd4-a4db-b49ee0ae0daa","year":2023},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.236107Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:1a2e7ebafd99ae2f2bf5bb22214094218376983c4ae3dd2249f23d30be1396ee","observation_id":"68c5216b-0cb4-41cd-865c-7b632db19664","resolution":{"observed_at":"2026-08-12T11:52:40.364753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.349578Z","title":null,"venue":null,"work_id":"84a9cec0-f251-401d-9ca7-a3158cba9553","year":2024},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.239399Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:e9b6dd98f8aed9ff1370bbc183bcfc81f6a1363d200bbe6637a3fb23ab78c176","observation_id":"c5c0e246-f380-40ce-a537-ffb182308105","resolution":{"observed_at":"2026-08-12T11:52:40.353998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T11:52:40.185201Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.185201Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:c185917f55763139e57db859e85194f2d9e491fdf1bd0355a881adea10bf4e0f","observation_id":"4eb2d010-1737-4871-ab99-21df792f0506","resolution":{"observed_at":"2026-08-12T11:52:40.185201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.394248Z","title":"Fedlion: Faster adaptive federated optimization with fewer communication","venue":null,"work_id":"33481112-907d-485b-b1a8-69a72cb18dc5","year":2024},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.220896Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:ec9cd90f37bf3c704b7a6ac2f5d955728fdbb1a86166446f59059ef9e06d6d1d","observation_id":"ab8ea634-c246-4fbe-8ea6-12cf0246c586","resolution":{"observed_at":"2026-08-12T11:52:40.398010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-13T11:54:17.209519Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-12T11:52:40.200833Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.200833Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:d5cc2b112f3a69ec1b8407f118fdcb92a4dd22160fdcc83cbdf34f9697a5fa46","observation_id":"45969739-6588-4308-8448-b4d3af42cff9","resolution":{"observed_at":"2026-08-12T11:52:40.200833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.04581","last_updated":"2016-11-14T20:59:54Z","snapshot_observed_at":"2026-08-14T21:30:28.408283Z","submitted_at":"2016-11-14T20:59:54Z","title":"How to scale distributed deep learning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.04581","snapshot_observed_at":"2026-08-12T11:52:40.193192Z","title":"How to scale distributed deep learning? arXiv preprint arXiv:1611.04581 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.193192Z"},"links":{"cited_paper":"/paper/1611.04581","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:f1d55845eb4fb5c6701b281695eb262176b2ee8b58fdfabb49aab66dc4605000","observation_id":"9c3be546-6f44-4312-8a1a-ebd0bc63e72a","resolution":{"observed_at":"2026-08-12T11:52:40.193192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.417497Z","title":"Scalable training of deep learning machines by incremental block training with intra-block parallel optimization and blockwise model-update filtering","venue":null,"work_id":"5dec0124-8b8d-45bd-b231-68194bb3dc7f","year":2016},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.180850Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:4fcb5266f98199c6ca2ea1277b81046e5b7c12235003bb18754b1b2d81c2f6a2","observation_id":"5a041328-1799-4128-826c-5fed2738dfc4","resolution":{"observed_at":"2026-08-12T11:52:40.421073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T11:52:40.196909Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.196909Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:588925c58c3167ba271b8f3c780feea2a84074d984e167a35682d1ad62b7ae58","observation_id":"c0f2abf1-8916-49a6-b3df-6bc4d073c8a7","resolution":{"observed_at":"2026-08-12T11:52:40.196909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:40.405987Z","title":"1-bit stochastic gradient descent and its application to data-parallel distributed training of speech dnns","venue":null,"work_id":"43e3e10b-755e-4f3c-9155-b2a3e0cff625","year":2014},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.213397Z"},"links":{"citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:049d1fe2dd72950027c139a7dfd5544be790c20e1382f9fc3fd41b77d926138d","observation_id":"0805b0f3-12ef-46ef-a7a7-a85b7a3d5f47","resolution":{"observed_at":"2026-08-12T11:52:40.410273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16265","last_updated":"2024-01-29T16:12:31Z","snapshot_observed_at":"2026-08-13T04:32:35.079763Z","submitted_at":"2024-01-29T16:12:31Z","title":"CO2: Efficient Distributed Training with Full Communication-Computation Overlap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16265","snapshot_observed_at":"2026-08-12T11:52:40.216892Z","title":"Co2: Effi- cient distributed training with full communication-computation overlap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T11:52:40.216892Z"},"links":{"cited_paper":"/paper/2401.16265","citing_paper":"/paper/2411.17866"},"observation_digest":"sha256:1c63db9f4f82137e9ea2b5db1257273ce941258d5de42e60e3e6194be9213712","observation_id":"5fad4a0a-d5b0-4dd0-bea0-65a68086b0c7","resolution":{"observed_at":"2026-08-12T11:52:40.216892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17866","last_updated":"2025-03-07T19:35:00Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T11:42:55.738715Z","submitted_at":"2024-11-26T20:31:11Z","title":"Distributed Sign Momentum with Local Steps for Training Transformers"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2411.17866."}