{"as_of":"2026-08-16T03:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a01099329b74b27a73dc6243cd183dffd62c5d2fd33bac6f00c84681e6cdaecc","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:16:10.422836Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:59:05.518604Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T07:00:43.273983Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10559","snapshot_observed_at":"2026-08-06T19:59:05.518604Z","title":"Neural thermodynamic laws for large language model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.518604Z"},"links":{"cited_paper":"/paper/2505.10559","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:66e0a84e45d96d9b43f6404557c4836586de1f26c8b7ca4f894a6d1f3499b1ab","observation_id":"52d8cbf4-a455-4428-b670-c19fcb8309d5","resolution":{"observed_at":"2026-08-06T19:59:05.518604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10559","snapshot_observed_at":"2026-08-06T11:44:05.058346Z","title":"Neural thermodynamic laws for large language model training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-13T04:44:29.930895Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:05.058346Z"},"links":{"cited_paper":"/paper/2505.10559","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:465799d0d291078ff2e7db29b47dd10568c12dbd575296c39cbe3f685af387ec","observation_id":"b88f9cc7-7416-4d8d-b8e8-91e37a2868d3","resolution":{"observed_at":"2026-08-06T11:44:05.058346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"cited_work":{"arxiv_id":"2505.10559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10559","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liu, Z., Liu, Y ., Gore, J., and Tegmark, M","venue":null,"work_id":"bb972541-553e-494b-9884-8b8054dcf1c5","year":null},"citing_paper":{"arxiv_id":"2602.04774","last_updated":"2026-05-08T16:24:57Z","snapshot_observed_at":"2026-08-15T04:58:48.280086Z","submitted_at":"2026-02-04T17:11:36Z","title":"Theory of Optimal Learning Rate Schedules and Scaling Laws for a Random Feature Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T06:58:38.927268Z"},"links":{"cited_paper":"/paper/2505.10559","citing_paper":"/paper/2602.04774"},"observation_digest":"sha256:97881d8f2d199ac6aee772e6fc479484af37757cf24ba29ffd7da8da6bb00e70","observation_id":"4617356d-24ea-480a-be5f-e57e497bff5e","resolution":{"observed_at":"2026-05-16T07:00:43.275595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10559/citation-record","integrity":"/paper/2505.10559/integrity","json":"/paper/2505.10559/citation-record.json","paper":"/paper/2505.10559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.276576Z","title":"Bayesian learning via stochastic gradient langevin dynamics","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.276576Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:41e252aaf64f09e705a3b4cc3c79edbb80bee2b6862b4673ee9007198a362cc5","observation_id":"d212e579-4736-4103-b4d3-8542c19ba52b","resolution":{"observed_at":"2026-08-15T21:16:10.276576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.849859Z","title":"Thermodynamics-inspired explanations of artificial intelli- gence","venue":null,"work_id":"ed1310de-3a7e-4743-8005-24b78fad9cd8","year":2024},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.281206Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:22bc2f975a54a2f7b8e6f255c090f9dc1e01dc976370978de7c61ac5a63c84d1","observation_id":"6a950008-b592-48e9-b839-c497e6d402ee","resolution":{"observed_at":"2026-08-15T21:16:10.854755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.837696Z","title":"Statistical mechanics of learning","venue":null,"work_id":"b5563567-e472-4f6d-8914-9944a27e9fd3","year":2001},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.285139Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:64ed352475c1c0da9245f554496caff9bb1ff30dc04c125b1dcbda0ffcc14dee","observation_id":"eb823f02-bcc2-435c-b0db-c5cca54d8faa","resolution":{"observed_at":"2026-08-15T21:16:10.841719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.825343Z","title":"Statistical mechanics of deep learning","venue":null,"work_id":"b5137be0-c95b-49bc-8cb3-af5d14e793e9","year":2020},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.288960Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:e965970de72ee6a677457af7acb90552b57107cda64cbdcf3d6b5492ca4515a3","observation_id":"4b77da36-8744-449b-9ffa-0d35359d4f31","resolution":{"observed_at":"2026-08-15T21:16:10.829349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-08-14T11:59:33.369609Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-15T21:16:10.293933Z","title":"Understanding warmup-stable-decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.293933Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:29cc4caa12a5ed53b249e60eb150fb8ecc07ac088ecf12ff876ed95dc16f2894","observation_id":"c0f021a9-d8f0-4eab-8225-95664e1e90bc","resolution":{"observed_at":"2026-08-15T21:16:10.293933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00195","last_updated":"2019-10-29T16:41:33Z","snapshot_observed_at":"2026-07-06T08:25:55.675662Z","submitted_at":"2019-10-01T04:13:27Z","title":"How noise affects the Hessian spectrum in overparameterized neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00195","snapshot_observed_at":"2026-08-15T21:16:10.299041Z","title":"How noise affects the hessian spectrum in overparameterized neural networks","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.299041Z"},"links":{"cited_paper":"/paper/1910.00195","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:2b2460c28e4831e008b5cabdd84c134c489c0a291cfefd1ceedbb73df459ccb9","observation_id":"11e2a7b6-6bce-48d9-8fae-5acc1ef8208e","resolution":{"observed_at":"2026-08-15T21:16:10.299041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12243","last_updated":"2025-01-21T16:03:42Z","snapshot_observed_at":"2026-08-12T03:11:50.876914Z","submitted_at":"2025-01-21T16:03:42Z","title":"FOCUS: First Order Concentrated Updating Scheme","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12243","snapshot_observed_at":"2026-08-15T21:16:10.303679Z","title":"Focus: First order concentrated updating scheme","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.303679Z"},"links":{"cited_paper":"/paper/2501.12243","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:4e18791d88403694ca2a37df301583df01869df93aea3b2979e19b9156f4294d","observation_id":"5705197c-17c9-408b-b4a5-fb1d4f50b76b","resolution":{"observed_at":"2026-08-15T21:16:10.303679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-15T21:16:10.308075Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.308075Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:e7795c5500d8e3840f690cdcc76b0878f404589bfde0eec39dc54260e6341668","observation_id":"3c1eea92-38df-4956-89e6-2fc88a336a71","resolution":{"observed_at":"2026-08-15T21:16:10.308075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00065","last_updated":"2022-11-23T18:09:57Z","snapshot_observed_at":"2026-08-13T04:20:08.395688Z","submitted_at":"2021-02-26T22:08:19Z","title":"Gradient Descent on Neural Networks Typically Occurs at the Edge of Stability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00065","snapshot_observed_at":"2026-08-15T21:16:10.312287Z","title":"Gra- dient descent on neural networks typically occurs at the edge of stability","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.312287Z"},"links":{"cited_paper":"/paper/2103.00065","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:bda5f24990b6481ca3b6b18fff21a3a0a94bd917e77f5e7b60cac3bca2ccfe9c","observation_id":"be573704-5082-4bfe-8460-94297b5b5030","resolution":{"observed_at":"2026-08-15T21:16:10.312287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.812531Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":"89dd34d8-7057-48d7-9109-16e38fd2108e","year":2024},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.316507Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:2b61bd90db8d03da7661c1e5a046268bdab2d5054139328685b157f1176924c6","observation_id":"a58f5b92-0d8c-46dd-a841-f45d69571120","resolution":{"observed_at":"2026-08-15T21:16:10.817150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.320808Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.320808Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:5c7b1538821dafb0e5b2a4b6e3da6aa001493b9b90f0b03b1fbf454193250b9b","observation_id":"54d121ff-1a49-4fc7-bda8-ba7003fa8064","resolution":{"observed_at":"2026-08-15T21:16:10.320808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.789687Z","title":"A multi-power law for loss curve prediction across learning rate schedules","venue":null,"work_id":"21f007f5-0a8b-4cbd-81c5-b6e0655d7046","year":2025},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.324525Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:b5886f4d496c664bc9e0243e292bfcda205dc29e1a4fc8c2b4508897cc8302dc","observation_id":"5b9dbac8-217c-4ea7-8ed3-ea12abddc571","resolution":{"observed_at":"2026-08-15T21:16:10.795287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.778056Z","title":"modded-nanogpt","venue":null,"work_id":"bef036a6-8c90-4e2e-8e3e-4e5f5cbf4d3c","year":null},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.328811Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:85ac37f70c58cf1511c551be14ab729dcd15cffd5c6bc4b4f0d1397f771dd829","observation_id":"adb2480a-b973-45ce-8c44-4d3486f0c5e2","resolution":{"observed_at":"2026-08-15T21:16:10.781648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11162","last_updated":"2022-07-18T20:57:25Z","snapshot_observed_at":"2026-08-14T22:17:56.692887Z","submitted_at":"2020-09-23T14:17:53Z","title":"Implicit Gradient Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11162","snapshot_observed_at":"2026-08-15T21:16:10.333148Z","title":"Implicit gradient regularization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.333148Z"},"links":{"cited_paper":"/paper/2009.11162","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:46049cc86f248e9525e7463d5239e894ebab20343c8fbaee5d082483b15db7f6","observation_id":"e10bec04-7f0f-4a15-9eab-f4feff0a122d","resolution":{"observed_at":"2026-08-15T21:16:10.333148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.766258Z","title":"The limiting dynamics of sgd: Modified loss, phase-space oscillations, and anomalous diffusion","venue":null,"work_id":"e3ce03f6-8d0a-4edb-8393-1aaa0e010e0e","year":2023},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.337208Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:63503f422e8aeaa58c6c79175ace2eb1f64d59f2ef0e3973281962a9570d6263","observation_id":"975e5bbb-1674-458d-926f-1134ba17a91b","resolution":{"observed_at":"2026-08-15T21:16:10.770762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.752779Z","title":"Stochastic collapse: How gra- dient noise attracts sgd dynamics towards simpler subnetworks.Advances in Neural Information Processing Systems, 36:35027–35063, 2023","venue":null,"work_id":"643afc0a-5a99-4147-85c6-28411cf057bb","year":2023},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.342128Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:8285d8c21b52f6b8f370e7fa8ba69d9c83864e98e916c98d39dc8f0f81887bc6","observation_id":"3fa17f3c-0219-4868-9251-f6ded64f650d","resolution":{"observed_at":"2026-08-15T21:16:10.757806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.740731Z","title":"Stochastic gradient descent as approximate bayesian inference","venue":null,"work_id":"5ae0fa4e-706a-4814-8798-12bc1412dd76","year":2017},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.346839Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:84682bad29ed720001d1ca739f980b59df618faa55e3c406aad0b17aca2e48a2","observation_id":"710f4bf1-39bc-443b-93ce-34b437911117","resolution":{"observed_at":"2026-08-15T21:16:10.744777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.03495","last_updated":"2021-01-15T14:57:46Z","snapshot_observed_at":"2026-08-11T18:27:27.592725Z","submitted_at":"2020-02-10T02:04:49Z","title":"A Diffusion Theory For Deep Learning Dynamics: Stochastic Gradient Descent Exponentially Favors Flat Minima","version":14},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.03495","snapshot_observed_at":"2026-08-15T21:16:10.351351Z","title":"A diffusion theory for deep learning dynamics: Stochastic gradient descent exponentially favors flat minima","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.351351Z"},"links":{"cited_paper":"/paper/2002.03495","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:c82547b16a511503a7fe3b1ef8cbb755c26cc8b076c49b91d64a9df7f8bc8cbb","observation_id":"3e756cd0-1ae7-49aa-b88d-f3b250cec91c","resolution":{"observed_at":"2026-08-15T21:16:10.351351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.02538","last_updated":"2021-03-29T17:24:24Z","snapshot_observed_at":"2026-08-13T21:07:52.676733Z","submitted_at":"2020-11-04T21:07:52Z","title":"Direction Matters: On the Implicit Bias of Stochastic Gradient Descent with Moderate Learning Rate","version":2},"cited_work":{"arxiv_id":"2011.02538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.02538","snapshot_observed_at":"2026-08-15T21:16:10.531773Z","title":"Direction Matters: On the Implicit Bias of Stochastic Gradient Descent with Moderate Learning Rate","venue":"cs.LG","work_id":"ecb93b0a-fb17-42e3-94bd-4475994fc9ef","year":2020},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.356219Z"},"links":{"cited_paper":"/paper/2011.02538","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:db3a870723560150269fbcdfe53b12efb5783accc25c8f9bb3e018debf7a5b6d","observation_id":"d89849d2-59be-42e7-80ce-2cfc42587224","resolution":{"observed_at":"2026-08-15T21:16:10.538298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05890","last_updated":"2020-12-29T05:33:37Z","snapshot_observed_at":"2026-08-15T11:57:36.424287Z","submitted_at":"2019-06-13T18:52:00Z","title":"Gradient Descent Maximizes the Margin of Homogeneous Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05890","snapshot_observed_at":"2026-08-15T21:16:10.360638Z","title":"Gradient descent maximizes the margin of homogeneous neural networks","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.360638Z"},"links":{"cited_paper":"/paper/1906.05890","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:3796f54af4de3ba957fee259687ae181d4452fa99aaa428596c93acb2b3e387c","observation_id":"dbec16f3-8046-48dd-9e77-15f4b5af7ac0","resolution":{"observed_at":"2026-08-15T21:16:10.360638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.727627Z","title":"The implicit bias for adaptive optimization algorithms on homogeneous neural networks","venue":null,"work_id":"1b87f1d8-10f3-4d07-afee-f72eb94f1b16","year":2021},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.364472Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:0d2739f85a3e6de3a31320f1d5c6c10b44f832df7d353503db4fe626bff6573a","observation_id":"1d8dc6a4-c009-475a-a7e6-526b7fd195d4","resolution":{"observed_at":"2026-08-15T21:16:10.732032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09484","last_updated":"2026-04-12T13:30:14Z","snapshot_observed_at":"2026-07-06T21:08:33.353144Z","submitted_at":"2025-04-13T08:50:24Z","title":"An overview of condensation phenomenon in deep learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09484","snapshot_observed_at":"2026-08-15T21:16:10.369421Z","title":"An overview of condensation phe- nomenon in deep learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.369421Z"},"links":{"cited_paper":"/paper/2504.09484","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:12cc403946291214ea474b75bcd7adbd1ca07b516c738e282b96f2090bc19057","observation_id":"5bf4fd29-7f62-4325-bc6a-6971e63bb0e1","resolution":{"observed_at":"2026-08-15T21:16:10.369421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.373316Z","title":"Loss surfaces, mode connectivity, and fast ensembling of dnns","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.373316Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:60f97f19d9c0fef69f238a6c3e2a19b5e90110382caa791064807b75410905a7","observation_id":"d30cc1f6-f2d3-4bec-8fef-f587ab01b983","resolution":{"observed_at":"2026-08-15T21:16:10.373316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.378385Z","title":"Linear mode connectivity and the lottery ticket hypothesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.378385Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:f51da8881e819322087db837d7fc8f417ca18be17404a1050e69d36b1107c711","observation_id":"e6fee98e-5454-4dfd-98ee-63807f5f9ac9","resolution":{"observed_at":"2026-08-15T21:16:10.378385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-15T21:16:10.382408Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.382408Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:234f750fa18b7fe05549901010956d61f51b5293fefe9e2b9f9dd6ec769ddebf","observation_id":"14003317-7996-4b1c-aa40-4bcd29f84b95","resolution":{"observed_at":"2026-08-15T21:16:10.382408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.699667Z","title":"Cyclical learning rates for training neural networks","venue":null,"work_id":"e2b0facb-9ee4-452c-aa5b-cedcecbde1c4","year":2017},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.386589Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:f36e138ea03cb2516ca46ca0aea23cfa5a8d03af2453922b899ccc38335b85d9","observation_id":"c9c19445-75c5-4c60-b43b-ed7169e8d14d","resolution":{"observed_at":"2026-08-15T21:16:10.703872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.391341Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.391341Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:8a14f6c99030323ac0875a2b40b31011d5cca89ea8d9990589393f1fb3ddce30","observation_id":"cae9e569-d9fb-44df-8f14-d605328e46c4","resolution":{"observed_at":"2026-08-15T21:16:10.391341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-12T16:03:20.142135Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-15T21:16:10.395835Z","title":"The information bottleneck method","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.395835Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:20a99fa8c6ac5e31d3701fd61fb3a0bc292fd25a15a12c2a75cdda1aaf186da3","observation_id":"389cbea2-8c0b-46ca-a545-57a66aebce39","resolution":{"observed_at":"2026-08-15T21:16:10.395835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.676864Z","title":"Entropy-sgd: Biasing gradient descent into wide valleys","venue":null,"work_id":"01c26d91-2202-471d-81a5-0f8de94584b1","year":2019},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.400168Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:89f4b66b3083f07bfba4cd4d3c958b38086bf7dbf8266800183c79752b57725c","observation_id":"cf45d999-1565-418a-abed-41956b681423","resolution":{"observed_at":"2026-08-15T21:16:10.681046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.663043Z","title":"A learning algorithm for boltzmann machines","venue":null,"work_id":"4311d8da-9e93-438d-951f-579df3831b10","year":1985},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.405438Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:edcb50621525c77e8e0caefa0a75995f8b177745b3d627130304c7b7808e079a","observation_id":"0221e432-621f-4859-9a46-591124545197","resolution":{"observed_at":"2026-08-15T21:16:10.667575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02217","last_updated":"2021-04-28T07:24:49Z","snapshot_observed_at":"2026-08-13T03:08:20.485293Z","submitted_at":"2020-07-16T17:52:37Z","title":"Hopfield Networks is All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02217","snapshot_observed_at":"2026-08-15T21:16:10.410063Z","title":"Hopfield networks is all you need","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.410063Z"},"links":{"cited_paper":"/paper/2008.02217","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:d526e94875d58dd040dd18d6a389fc78f40f974d105ada934297a4243b048d70","observation_id":"98bdeea6-d6e2-4d6d-96de-4eb885ceffae","resolution":{"observed_at":"2026-08-15T21:16:10.410063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.414092Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.414092Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:22e59893d7a6285cc8c3d89a28c73329290a07e15e2e265a6c6286a25cb73886","observation_id":"9c2a8453-6e38-4eb4-804f-834e09498e3a","resolution":{"observed_at":"2026-08-15T21:16:10.414092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-15T21:16:10.417979Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.417979Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:701be5c9b207860e6245c6ff69e7d54505c20c874500abe3be584364a0763e6f","observation_id":"30cca370-659f-4db5-9d77-e0379a008b63","resolution":{"observed_at":"2026-08-15T21:16:10.417979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:16:10.642863Z","title":"edge of stability","venue":null,"work_id":"eeb75865-b924-471e-8068-c313e2728175","year":2020},"citing_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:16:10.422836Z"},"links":{"citing_paper":"/paper/2505.10559"},"observation_digest":"sha256:5dae8f082e4fc5000040fa9aa1eaecb5d167cf28f56af23be9b597887c7f6de0","observation_id":"8430a16a-5d30-48c7-a45d-43a0ab8ab73c","resolution":{"observed_at":"2026-08-15T21:16:10.647787Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 3 inbound Pith citation observations for arXiv:2505.10559."}