{"as_of":"2026-08-09T19:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4953d062a2ad42af9dca5c8ede80946b299743e1247f1d4b6e8fe894c8267699","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T18:00:57.430970Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.13894/citation-record","integrity":"/paper/2606.13894/integrity","json":"/paper/2606.13894/citation-record.json","paper":"/paper/2606.13894"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:34fe90d570a1f08b232e7d4a4aa4b1014077ad78cb07e37503ae5f74797f57f0","observation_id":"8f6812a3-4454-4bfd-bcee-ffd30c9aebcd","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Np-hardness of euclidean sum-of-squares clustering","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d663b3bc571cde0882a505078248be74625cc788b90ff71403871afe203ac331","observation_id":"c2f47ac6-a85f-4320-afec-3bf69847f0ec","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Memory efficient adaptive optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d08550072bc16a7c65eeeb3d9d5c9a512b5342c1ab63b777380320258105c59c","observation_id":"0225f9de-8db4-4f62-bc51-1276a8e01be4","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"An iterative algorithm for computing the best estimate of an orthogonal matrix","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d77975a6bb2f47058f1c3a083abfab3f9b672acbcd5a28b9b49636b5f4d7c73a","observation_id":"e905a720-760c-43b2-9bb4-4c07ed4b5072","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6ef3e7ee457ffd304fd9c3e89001002d8d60be7b0f0b25dfcce78ac5bb286ab4","observation_id":"6addacb6-fb40-445e-88ee-5488e8c2b6b0","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Large scale machine learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:5203ddcac0cbdc93652265de6d0f7f8a797b2cb3c1ca4fb1060f081f5b97eaa8","observation_id":"138c125e-e36b-4b27-a69f-e2f71819bc1b","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Random projection trees for vector quantization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:b9134c8ee2f0112f07549ed67aa633894a4a39695ae02969aec5a09129cbd2df","observation_id":"9275a8b0-2b7f-4f83-b4c4-bbdf9445317f","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6cced877b833e52099676092691e01ef486f545c944cc450f22dcf7323dd3958","observation_id":"7f1d67dd-c340-420d-a4e5-e688e4d951aa","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:0454bbe7d826a59ff86dce5eb5d8118b5f4d2678abf247f03109e8d169ee4801","observation_id":"85af1874-7e65-4b84-a222-377e963a6480","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a9650d68771b789161b5daf7593467b322c28bbfbaee9580ffa8777cc342c550","observation_id":"b738f9bc-0791-46c1-9ef0-ff202bf5098e","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:13b9305fdf5dbac3795951f58d26b6a44d316654a1c522afd14571de3ca40a2d","observation_id":"46c78d12-1f4a-4c5f-b52f-c1ed39ab3028","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Functions of matrices: theory and computation","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:e48cb9b0bbdaa82cc964cdd9fa5709497b2cf2f27ee29131f4cc6b273a2eb2b6","observation_id":"2afd527b-6ce6-4128-b845-97041a9884ff","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:9d72241f108cb03d4bfdcc1532cae988ec600b25c10a976a63afd72491c2900f","observation_id":"39f95338-3a1f-407a-ae8c-b729621bd3b0","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Zo-adamu optimizer: Adapting perturbation by the momentum and uncertainty in zeroth-order optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:32b03178f34012f5f658fdedcb39d8dca7676a3592d5b31f09e35b62a44701ac","observation_id":"e664e3f3-3c39-41b6-b44e-141b42191c9e","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Muon: An optimizer for hidden layers in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:4323e9a5801c301dc5d40cd549ebf2716f8a3631a2ee340b9e353bd21bcd9815","observation_id":"79dd8bcf-e7dd-4c91-a95e-dc2f008cec7a","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:eb093e12e4e50fd6cce2b41a2eefca17a8ef16c85b8ed7322fc9dfeec2afc03c","observation_id":"a32e3a7b-2029-4d69-954e-3b4b4117c1db","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Numba: A llvm-based python jit compiler","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:0801cbd4e3272409999c76c7c71f06d80e64b85a016efbc3443031a0471075b4","observation_id":"e91f4ac9-2b52-4113-a981-9b87bbb1629e","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Handbuch der Lehre von der Verteilung der Primazahlen, volume 1","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a57006d9eba678d4f317fdc583ca6eaba27e86e6c62c554d4f5ad766b40bab1e","observation_id":"93e98d3b-50b4-4fb5-9fc8-7fefd1d0c5f4","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Memory efficient optimizers with 4-bit states","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:b3d2c4a642f3172c2c5eb34596459acbd0cec8023854d068b83317e947e12d58","observation_id":"e346bb63-7be6-46af-ab0a-7518ac7a6f71","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:a010d1fe1b91f2daf787472df6dffdde45fb5db06d799d8ca375566b450e4118","observation_id":"12d9afed-7b30-432e-bf15-f0404ee74fff","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:c630bd5efc138b3d383e13b35b3d2d38bb96eafb6764ffcb9543bb9836d9f055","observation_id":"53b75470-b39b-4710-8957-bbb1912ef668","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d3f6ff412f6de93a587d02f97e6347be747891f7b9dd9ca34a7c84f499ec6dcf","observation_id":"b1f6cced-5322-48ce-b26d-fb8f758078ce","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Sparse mezo: Less parameters for better performance in zeroth-order llm fine-tuning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:b85ee0d3d72167cbf2aa136475c64bb85bb18bfe55c5f905f6588bf636174074","observation_id":"a6e52bf2-2449-4e61-8172-99449d7880ae","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Least squares quantization in pcm","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:9079ecc49d22b5a78350e97139f0aff76f824e3532ac11bd53ef53a7eff8d8eb","observation_id":"a0a4ab07-0fe3-41c5-9579-e3224fce9301","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:1999dc2d2fc45d00906326fa308987010e632e64475afef955e6460acab01a4e","observation_id":"384d3efe-73ee-4b0b-80ee-b4ea6a2c5371","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"The planar k-means problem is np-hard","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:11e493aa60053653bd4fa1e2f0c30cdd6b170f931e93267402ca967e0d24bbd5","observation_id":"6f4ae7f8-35a7-4896-bb2b-a240ec3158c2","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Fine-tuning language models with just forward passes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:e1b85bab5d3f910d9e6f875bf73f79057021c6ec2eb015f01944e21c00c7ca89","observation_id":"f6d9402a-3cf0-45ca-a119-0dbbf7d585c0","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Quantizing for minimum distortion","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:f9b4ecb604c2ecba40bf305127e4469e18fb73b8c562f0c1868fd1c849c11c16","observation_id":"ecbfbafc-18c0-4c9a-b0a6-a714d1b41c35","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:6c67a45a2785c41bebdf463224a27365de30441e5600b19d600c428d34411f62","observation_id":"5730d76e-5a39-4a69-9f6c-78f49350b1d6","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:26a6b913f9d424c51b5b83963dbbf6f925d36662297e340e01f8604f5c5f208a","observation_id":"93746005-a7cf-4b2b-988a-c35dae172d84","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"On the convergence of adam and beyond","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d5e6b2ca980c407878bd05c44a9599bb74d549979cc48d0a29dbe8f63de072a7","observation_id":"97d9e0c7-af1c-4dca-bdac-53ace300bc35","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:0c9ec80b9245f1619fb6266ed74397dbcda5a5e55208c74c723def09c9360dcf","observation_id":"dc38fdc9-6abc-4449-80eb-fd26e2a18c28","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:74979742ba67474ce5efba68dd710e0f372931d009168426ae538806302a9db7","observation_id":"f7590544-3a80-4563-ab13-4e103d6206be","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Multivariate stochastic approximation using a simultaneous perturbation gradient approximation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:18b9ac0debdfe68a3553cace200b479fe4b31f6453595492e1c92b8197faa0ff","observation_id":"45cc02dd-fccb-4bc6-b562-1ef0e63187ae","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"1-bit adam: Communication efficient large-scale training with adam’s convergence speed","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:8b508b34621fb9601fb9a47b1248047544c03b67e4f810ea21df7946fa08c287","observation_id":"13eb5fb5-9d7c-4189-986c-97ba772a70f4","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Lecture 6.5--- RMSProp : Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:38c2a896273cef536d63c2eecb9693919679c3e6bf0b70086698ec700826e464","observation_id":"a0def7a2-7aca-4364-909d-8f88fe67ca3f","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:5e60b23540580975a13e98495ba6bd779ee257269b5a2ddbf7b340bfe4ddcb3a","observation_id":"6f360add-e4f1-4494-9d19-7baad823e969","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:345dcbf99cb313f6ff3058fdb258b569d456c372a8c5d6e6907ec06c3f337fed","observation_id":"5da9ef35-bc49-46a8-be24-38904db5e7ca","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:89ee84d003c6b47c39e2f17e4578489035c89aed6bbebd5c405353fad7312732","observation_id":"12e0b49c-c5d1-4adf-b3c4-8ec2f3132834","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"Pan, Zhangyang Wang, and Jinwon Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:77a49a143c6e871ef21fc3a75969bd652ee2c9d005b84b18341eaae418276778","observation_id":"fc6b2427-7f56-471d-a466-d846900c002f","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:038169aa55fccf156d89661b919d6b9007748c937246417533eaa33d70e67042","observation_id":"34ebc49d-2bf2-4fb1-9bff-3ff7bc54e8b8","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:9d5c9d1a3b6cff0a84c0aa977412a5ac217eec6873f156f17a26bdae84f73861","observation_id":"21d9ae32-dc5c-42b5-919a-7e4239de7ae7","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T18:00:57.430970Z","title":"attn\" and","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-14T18:00:57.430970Z"},"links":{"citing_paper":"/paper/2606.13894"},"observation_digest":"sha256:d4b7600a99ef500a307f9d91507919dab1dc42fe19ee414ba127f3c7d7016325","observation_id":"155e95a1-6711-4e44-9138-24f0b0db2745","resolution":{"observed_at":"2026-07-14T18:00:57.430970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.13894","last_updated":"2026-07-12T13:45:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T11:47:00.488509Z","submitted_at":"2026-06-11T20:38:09Z","title":"Gefen: Optimized Stochastic Optimizer"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.13894."}