{"as_of":"2026-08-10T03:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2810a605e82da8bea393e5d8f2cd839737c0859fa05f88dee1dce8fe5b435fb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T23:37:30.217739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-09T23:37:30.217739Z","title":"Xiao, Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling , arXiv e-prints (Sept., 2024) arXiv:2409.15156, [arXiv:2409.15156]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18419","last_updated":"2025-03-02T02:18:54Z","snapshot_observed_at":"2026-08-09T23:31:00.248470Z","submitted_at":"2025-01-30T15:16:09Z","title":"Optimizers for Stabilizing Likelihood-free Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T23:37:30.217739Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2501.18419"},"observation_digest":"sha256:a177738338cbc98bf22443ac8dae773ab7feb263095e3b669c9df38540933d7d","observation_id":"757969a4-aaae-4192-9c69-763805ecd373","resolution":{"observed_at":"2026-08-09T23:37:30.217739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-09T21:56:50.797601Z","title":"Rethinking conventional wisdom in machine learn- ing: From generalization to scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18965","last_updated":"2025-07-23T13:03:41Z","snapshot_observed_at":"2026-08-09T21:45:42.546566Z","submitted_at":"2025-01-31T08:55:56Z","title":"The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T21:56:50.797601Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2501.18965"},"observation_digest":"sha256:71fb962169fb24c96ad89d08851931ad1f3e328103947d9904fe250123b687a1","observation_id":"63c08d1b-7f65-464c-9cc5-dde6561344ff","resolution":{"observed_at":"2026-08-09T21:56:50.797601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-06T20:48:55.089882Z","title":"Rethinking conventional wisdom in machine learning: From generalization to scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02119","last_updated":"2025-07-07T06:13:26Z","snapshot_observed_at":"2026-08-09T03:48:37.458741Z","submitted_at":"2025-07-02T20:03:34Z","title":"Scaling Collapse Reveals Universal Dynamics in Compute-Optimally Trained Neural Networks","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T20:48:55.089882Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2507.02119"},"observation_digest":"sha256:f8659ba71fb1a553a7c9718bfdab530c17af16af59216e5c3257db263f797e91","observation_id":"daf49d49-f471-46bf-8352-787c0b0f9991","resolution":{"observed_at":"2026-08-06T20:48:55.089882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2508.17784","last_updated":"2026-04-12T14:04:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T08:26:43Z","title":"Proximal Supervised Fine-Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T20:42:14.423836Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2508.17784"},"observation_digest":"sha256:8b79926577c619e0c460b4659d24902bd24983bd424f573f29215ed961a1e200","observation_id":"24be7fbe-5afa-4084-82cf-c93fe5e8a55a","resolution":{"observed_at":"2026-05-18T20:42:50.938439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2604.20244","last_updated":"2026-04-22T06:46:22Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T06:46:22Z","title":"Hybrid Policy Distillation for LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T00:41:21.984760Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2604.20244"},"observation_digest":"sha256:4e1b13ded5c83f38baf016379a16ed6ca71fca34323b15c07db1af39f2a7b78c","observation_id":"527004a7-5077-456c-b76c-e82b561cccf9","resolution":{"observed_at":"2026-05-10T00:54:49.094867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.11172","last_updated":"2026-05-11T19:30:47Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:30:47Z","title":"Optimistic Dual Averaging Unifies Modern Optimizers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:52:16.805180Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.11172"},"observation_digest":"sha256:b346f193e5508c71fcb10bbae35bb4291564b7cdfadc882c01e2600f5911e71d","observation_id":"ce67e99d-b37c-4c07-87fd-1c75f94b1a39","resolution":{"observed_at":"2026-05-13T05:52:21.820665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-20T08:48:42.019359Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:7ce461c63b41f0eb18a10367335b58d29ffc7597479c4d3759c2c9fe2131922f","observation_id":"b377593c-9c5e-46a3-b080-5196e00c8f74","resolution":{"observed_at":"2026-05-20T08:53:24.521254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":2},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-06-30T18:27:40.390908Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:e435070ec101bb609d12ed1073e4a44952a9a0fa96fd2bedf38812310047bf98","observation_id":"010fdcdb-907d-4be6-867d-88901900660e","resolution":{"observed_at":"2026-07-01T14:55:48.592221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling","version":2},"cited_work":{"arxiv_id":"2409.15156","doi":"10.48550/arxiv.2409.15156","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15156","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ArXiv Preprint: 2409.15156 , Year =","venue":"arXiv (Cornell University)","work_id":"26c08f78-ce3d-40da-8b82-ff9dab86e5e7","year":2024},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2409.15156","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:577d31afce9b308613f052a8d3f4bf798f2fa36d4896bbeb36ce21b76efce95b","observation_id":"4db49b23-7097-4ab0-bdba-ff97cab57064","resolution":{"observed_at":"2026-06-29T08:03:13.498564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2409.15156/citation-record","integrity":"/paper/2409.15156/integrity","json":"/paper/2409.15156/citation-record.json","paper":"/paper/2409.15156"},"outbound":[],"paper":{"arxiv_id":"2409.15156","last_updated":"2025-02-14T04:54:23Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:04:03Z","title":"Rethinking Conventional Wisdom in Machine Learning: From Generalization to Scaling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2409.15156."}