{"as_of":"2026-08-15T21:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0bb9086bffa75e5074ef8005e1cb5804487ff792d9b84494fd86c79bf72872e","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:59:06.021532Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T08:04:06.432613Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04206","snapshot_observed_at":"2026-07-14T08:04:06.432613Z","title":"arXiv preprint arXiv:2507.04206 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10959","last_updated":"2026-07-12T23:24:42Z","snapshot_observed_at":"2026-08-03T13:16:14.672928Z","submitted_at":"2026-07-12T23:24:42Z","title":"WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-14T08:04:06.432613Z"},"links":{"cited_paper":"/paper/2507.04206","citing_paper":"/paper/2607.10959"},"observation_digest":"sha256:398651472e91d6dfabd777fc80925367813e8cff1126d05be5988125ab26e480","observation_id":"5519170b-8034-4edf-8eb0-c05edc37795f","resolution":{"observed_at":"2026-07-14T08:04:06.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04206/citation-record","integrity":"/paper/2507.04206/integrity","json":"/paper/2507.04206/citation-record.json","paper":"/paper/2507.04206"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-06T19:59:05.115154Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.115154Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:192d5ed1e6599713eadb65906ea0c60e12a4478948b6c17089773853e4923663","observation_id":"4cf05d37-47c2-4ac6-9b1c-93477e120c7e","resolution":{"observed_at":"2026-08-06T19:59:05.115154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05192","last_updated":"2024-12-02T21:54:54Z","snapshot_observed_at":"2026-08-14T11:59:33.369609Z","submitted_at":"2024-10-07T16:49:39Z","title":"Understanding Warmup-Stable-Decay Learning Rates: A River Valley Loss Landscape Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05192","snapshot_observed_at":"2026-08-06T19:59:05.216957Z","title":"Understanding warmup-stable- decay learning rates: A river valley loss landscape perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.216957Z"},"links":{"cited_paper":"/paper/2410.05192","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:c817eb846b761c92b068dabb406448eeb835f07c4ed6f5770c6cce4cadc9c5f4","observation_id":"46ec7f39-826e-43f3-ad28-e178f90c2d64","resolution":{"observed_at":"2026-08-06T19:59:05.216957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12243","last_updated":"2025-01-21T16:03:42Z","snapshot_observed_at":"2026-08-12T03:11:50.876914Z","submitted_at":"2025-01-21T16:03:42Z","title":"FOCUS: First Order Concentrated Updating Scheme","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12243","snapshot_observed_at":"2026-08-06T19:59:05.396551Z","title":"Focus: First order concentrated updating scheme","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.396551Z"},"links":{"cited_paper":"/paper/2501.12243","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:6699d345cde065aef1c19898f151d1456eb53ad71028ce360034bae5c83c0887","observation_id":"a5b58d3f-becb-42e6-8659-1b47594e9bf5","resolution":{"observed_at":"2026-08-06T19:59:05.396551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10559","last_updated":"2025-05-15T17:59:22Z","snapshot_observed_at":"2026-08-15T21:04:52.360528Z","submitted_at":"2025-05-15T17:59:22Z","title":"Neural Thermodynamic Laws for Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10559","snapshot_observed_at":"2026-08-06T19:59:05.518604Z","title":"Neural thermodynamic laws for large language model training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.518604Z"},"links":{"cited_paper":"/paper/2505.10559","citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:66e0a84e45d96d9b43f6404557c4836586de1f26c8b7ca4f894a6d1f3499b1ab","observation_id":"52d8cbf4-a455-4428-b670-c19fcb8309d5","resolution":{"observed_at":"2026-08-06T19:59:05.518604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:07.142149Z","title":"Nonequilibrium thermodynamics of the markovian mpemba effect and its inverse","venue":null,"work_id":"8a649e7c-9c03-4c6d-80d8-65a61e384f8c","year":2017},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.614435Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:3021ea9f11b84f2734cdc9cd6c3146ce6bf51135ee9972efc92ef298c0f767b1","observation_id":"8cff97b3-c0e2-4bb3-9cb2-190188754944","resolution":{"observed_at":"2026-08-06T19:59:07.184869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:07.038103Z","title":"Mpemba index and anomalous relaxation","venue":null,"work_id":"74d9d106-9f9a-4ae3-851a-5ef272169e34","year":2019},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.692399Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:1812236e120d60d92e0038dd92a6309c6a87922044cb3f175fe070afb4fa3a87","observation_id":"e5b96d5b-d2a8-448f-b998-e1d83a34acaa","resolution":{"observed_at":"2026-08-06T19:59:07.093283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:05.755041Z","title":"Speedups in nonequilibrium thermal relaxation: Mpemba and related effects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.755041Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:62ef461a7d1fc2279a186e7c8a2c1bac23052cc860336a4780a97ca94239efb3","observation_id":"c7c9f9b5-f3a5-4cc0-8977-b2f191fee7c4","resolution":{"observed_at":"2026-08-06T19:59:05.755041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.900941Z","title":"Precooling strategy allows exponentially faster heating","venue":null,"work_id":"1e2ad2b6-d8ca-4639-99a2-e7980ea70eab","year":2020},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.829010Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:b2ba2359cb70e27404484250df259c4b3e243642ea801de773cad115fcf5aab6","observation_id":"7123ae6c-5701-4eb4-9fc2-dad18be8ad8e","resolution":{"observed_at":"2026-08-06T19:59:06.945544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.765674Z","title":"Shortcuts of freely relaxing systems using equilibrium physical observables","venue":null,"work_id":"d6fdd902-cf41-4d0d-aa16-5ee7cb0d31d3","year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.884719Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:08fa1da610645985520e204ba563fce3dfa28c65c1f664b6821732a46981c13f","observation_id":"eaf1d537-f2e9-41ce-9000-fcb7351cf080","resolution":{"observed_at":"2026-08-06T19:59:06.817123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.649320Z","title":"Stochastic gradient descent introduces an effective landscape-dependent regularization favoring flat solutions","venue":null,"work_id":"7260b222-e210-45f4-abaf-60d4473e7912","year":2023},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.943662Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:a5221a3bacf9121a76b44e2829887c3f488a0d3fd5ec65cdeb5d43c495eb8e7d","observation_id":"af8d4fb4-6ceb-48bc-9cd6-5e16548c12ca","resolution":{"observed_at":"2026-08-06T19:59:06.714162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.424622Z","title":"Analyzing & reducing the need for learning rate warmup in gpt training","venue":null,"work_id":"b37c6a24-2443-4af6-9e81-ccfcadcc6239","year":2024},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:05.982823Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:023880c4c1876de50a425c67ba2bd709620c1d15a95867f71f445190af58e78c","observation_id":"e64ce85d-9390-418e-9228-5598d797d7cc","resolution":{"observed_at":"2026-08-06T19:59:06.545824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:06.187570Z","title":"temperature","venue":null,"work_id":"834c73bd-8c90-4482-ab21-85a4b91bddad","year":2023},"citing_paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:06.021532Z"},"links":{"citing_paper":"/paper/2507.04206"},"observation_digest":"sha256:20d244f5a63fe0ee0e98b02ce858576e9e78c7c9cb277fb2173927206e8284e1","observation_id":"15a7b24f-10fe-45ba-b736-8e028fc9f911","resolution":{"observed_at":"2026-08-06T19:59:06.294133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04206","last_updated":"2025-07-06T01:34:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T19:30:18.164472Z","submitted_at":"2025-07-06T01:34:12Z","title":"Mpemba Effect in Large-Language Model Training Dynamics: A Minimal Analysis of the Valley-River model"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2507.04206."}