{"as_of":"2026-08-09T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46775bcc9bffcf30febcae05ac905184dfa5f086dd519b7a394794476161bc21","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:26:16.502646Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07547/citation-record","integrity":"/paper/2502.07547/integrity","json":"/paper/2502.07547/citation-record.json","paper":"/paper/2502.07547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1511.06481","last_updated":"2016-04-16T19:40:08Z","snapshot_observed_at":"2026-08-04T02:15:07.648409Z","submitted_at":"2015-11-20T03:09:43Z","title":"Variance Reduction in SGD by Distributed Importance Sampling","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06481","snapshot_observed_at":"2026-08-08T12:26:16.116922Z","title":"Variance reduction in sgd by distributed importance sampling","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.116922Z"},"links":{"cited_paper":"/paper/1511.06481","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:28052905cdc9b0f5d75846057b72818e6e4b07ed78483b308429317dbf08cdd9","observation_id":"8e048ba3-446e-4663-9855-c982b44b668e","resolution":{"observed_at":"2026-08-08T12:26:16.116922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.121616Z","title":"Towards understanding sharpness-aware minimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.121616Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:361498f7fad443c41cd3c544d875ffb5650bbdf3e7f7bea935e67143847698da","observation_id":"cde0bafc-eba4-42da-83c4-6a92d1f51ff8","resolution":{"observed_at":"2026-08-08T12:26:16.121616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.125729Z","title":"A closer look at memorization in deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.125729Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:95de6d8ae6e288ba9323f28169282b24f500881d95946041174f78217d51c9f4","observation_id":"2b60b726-f017-445c-8527-fff677ed806c","resolution":{"observed_at":"2026-08-08T12:26:16.125729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.129666Z","title":"Reconciling modern machine-learning practice and the classical bias--variance trade-off","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.129666Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:bcbcb19aba851544a64b8a9b8f6384c40d8a2940661728cc25ba058b89a25b00","observation_id":"3b1fcb80-b219-4b80-a498-2b28e60215cf","resolution":{"observed_at":"2026-08-08T12:26:16.129666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.133702Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.133702Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:1179a3287a17e3dbef0e76fa00e9e2221608f73d30ecd7cbedb3ec4ad7064b9a","observation_id":"06b6e04c-0ed8-43b4-abeb-1affa05f4608","resolution":{"observed_at":"2026-08-08T12:26:16.133702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.137653Z","title":"The power of uniform sampling for coresets","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.137653Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:84bdc82c2cc4abb61ebb8c5f6eb023e180bbf0119d9d58b7ffe906f0ee780e5d","observation_id":"a944e403-4b7f-42f9-930d-8a4aa68fc302","resolution":{"observed_at":"2026-08-08T12:26:16.137653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.141956Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.141956Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:bd7d2c0f4cb5cfd9c96b421355ca46331dc8c388e579c901da99fb56e8d576db","observation_id":"c3f14ccd-f51c-415c-83c4-463d17041cdc","resolution":{"observed_at":"2026-08-08T12:26:16.141956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.146016Z","title":"Learning imbalanced datasets with label-distribution-aware margin loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.146016Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:ad70762c60f2008af44f50160045276975ef26d210b93af2eb196fa019725ee3","observation_id":"a84fe3ea-3b43-49e9-9b2b-f8532916dd66","resolution":{"observed_at":"2026-08-08T12:26:16.146016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.149921Z","title":"Overfitting in neural nets: Backpropagation, conjugate gradient, and early stopping","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.149921Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:99e27cbfeb4419022e83c098f3aa37472955c76441b9e9e2a48e7f19bb2d314c","observation_id":"d0728b77-881e-4c78-a1a3-94c84128f7cb","resolution":{"observed_at":"2026-08-08T12:26:16.149921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.154019Z","title":"Active bias: Training more accurate neural networks by emphasizing high variance samples","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.154019Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:00bee5c3714c82fcd6ad8364dbc891ebe85105c93e435635dde7028049f965cb","observation_id":"2ccac311-407a-43d2-aca1-dcc3086aa55f","resolution":{"observed_at":"2026-08-08T12:26:16.154019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-07T13:44:53.690521Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-08T12:26:16.157767Z","title":"Rethinking atrous convolution for semantic image segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.157767Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:1613c0514e85b8c0d0fb61cd5be3857d408a9a27ef6b73876444d390f26cb96e","observation_id":"29dd764c-9916-44cf-a9df-c46de759833d","resolution":{"observed_at":"2026-08-08T12:26:16.157767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.161966Z","title":"Importance sampling for minibatches","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.161966Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:9166b6d3f2f2c0e36decf4ca07717ad9c17ba92867e0b6802cca5952374c50a9","observation_id":"22e7138f-efa0-44ee-a206-d1f038404535","resolution":{"observed_at":"2026-08-08T12:26:16.161966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.165655Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.165655Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:1c00041af734911474ab800896afcebc2cd180fadc7a1ec48b7a50ed2ef6194a","observation_id":"1ec14932-ed25-4d2c-a0f0-fd30a05023c7","resolution":{"observed_at":"2026-08-08T12:26:16.165655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.169179Z","title":"Identifying and attacking the saddle point problem in high-dimensional non-convex optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.169179Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:4c0055770c750f409e13e9b9cbdc0831a4f2aa7359b04a807f5db3de501b24f7","observation_id":"439c1cf4-096b-4026-81ba-5ed178b5d781","resolution":{"observed_at":"2026-08-08T12:26:16.169179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.172913Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.172913Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:a46bdb96fa875c6a9b542a3ab47317cda1d298e106ac52ef6b05ee14f60de28c","observation_id":"1d323382-db6a-41df-b743-03d08bb79c64","resolution":{"observed_at":"2026-08-08T12:26:16.172913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.176762Z","title":"Sharp minima can generalize for deep nets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.176762Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:e0ba3d242d7189f1977ecdaf3ffc81019fb20c6329fc8b6ae11e2f479a42ce1a","observation_id":"97f7be2e-81c9-43a9-934b-e07f6e5b430e","resolution":{"observed_at":"2026-08-08T12:26:16.176762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.180786Z","title":"Everingham, L","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.180786Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:ca64589c4d84fef57798d3c5261cf24a9fbe61d3bb80869908ea2c4678b54767","observation_id":"65daa6d7-b390-479a-9ef6-4bac19503f90","resolution":{"observed_at":"2026-08-08T12:26:16.180786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.184497Z","title":"Everingham, L","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.184497Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:dfcd688539610b08eb4607515022d8e97235cdf6592b4b754f76bcacb9ee9848","observation_id":"9c3dbe42-7e08-4dcb-81cb-192764977b03","resolution":{"observed_at":"2026-08-08T12:26:16.184497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-08T12:26:16.188439Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.188439Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:810f4c282159051fe2b672b87e656d60d8992569ed4f59c89dafb3a2a51fda16","observation_id":"7e2650fa-ead3-4380-9de9-d6ecac5cd0b8","resolution":{"observed_at":"2026-08-08T12:26:16.188439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04290","last_updated":"2024-02-06T08:30:47Z","snapshot_observed_at":"2026-08-06T15:08:55.860114Z","submitted_at":"2024-02-06T08:30:47Z","title":"CasCast: Skillful High-resolution Precipitation Nowcasting via Cascaded Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04290","snapshot_observed_at":"2026-08-08T12:26:16.192465Z","title":"Cascast: Skillful high-resolution precipitation nowcasting via cascaded modelling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.192465Z"},"links":{"cited_paper":"/paper/2402.04290","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:2e605fdb31be28f72b31af0a97cd86cae389c187fb4135878269747f866f14be","observation_id":"989a6aed-3d9b-4a2a-ab24-02131ad9b4ca","resolution":{"observed_at":"2026-08-08T12:26:16.192465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.196802Z","title":"Deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.196802Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:7478877f35522e7b3a674c578512507a8e7d47af97404042f15f974b569a6009","observation_id":"7189ee7f-847f-4c9a-837a-48706d6324a4","resolution":{"observed_at":"2026-08-08T12:26:16.196802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.200548Z","title":"On calibration of modern neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.200548Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:b8bfdf06cc41936b6d5dc0a29547a3401f6c7b4ce7c10e709207741cbffb6e33","observation_id":"1fd25e03-d344-4445-91d0-c16cb2237716","resolution":{"observed_at":"2026-08-08T12:26:16.200548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.204274Z","title":"On the power of curriculum learning in training deep networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.204274Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:14476bc011f0b989bd5ab6b0136d1b4c9b013d7cd519d6c3150d442a1bfbde3d","observation_id":"5bc61b0f-ebc9-4b92-a9dc-5d8964ab4368","resolution":{"observed_at":"2026-08-08T12:26:16.204274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.208074Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.208074Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:016b7ec3f2e5152f6a6ac6206a477b23793bc1cef174f562817491b1d0848255","observation_id":"d154fe14-b3f4-4b1d-a0b1-1c53c1db5754","resolution":{"observed_at":"2026-08-08T12:26:16.208074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05175","last_updated":"2024-06-14T05:10:07Z","snapshot_observed_at":"2026-07-06T15:40:16.429096Z","submitted_at":"2023-06-08T13:14:35Z","title":"Large-scale Dataset Pruning with Dynamic Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05175","snapshot_observed_at":"2026-08-08T12:26:16.211936Z","title":"Large-scale dataset pruning with dynamic uncertainty","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.211936Z"},"links":{"cited_paper":"/paper/2306.05175","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:29924a1573a3d338feaaf83cd5733d27491a148fb25b07a8d3680c9c35515021","observation_id":"8931630b-f3cf-4c2c-8a9e-7eaf811cc285","resolution":{"observed_at":"2026-08-08T12:26:16.211936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-08T12:26:16.216274Z","title":"Deep learning scaling is predictable, empirically","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.216274Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:0c4774aa77b75e37c1833842833a5b48dcc5f08a3bd9300f6e5757cefef39f4b","observation_id":"122290dd-2c55-4206-adca-607bfe3498f4","resolution":{"observed_at":"2026-08-08T12:26:16.216274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.220293Z","title":"Flat minima","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.220293Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:70ab2b786b720542ff583fb41844f91d2d564486b9b634125ea21b2aa5e50bd4","observation_id":"186cc7dc-b3a7-4ca1-ad90-f9aeaf005a6c","resolution":{"observed_at":"2026-08-08T12:26:16.220293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.224011Z","title":"Ridge regression: Biased estimation for nonorthogonal problems","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.224011Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:d13b11fd7deba89b3d9d252b5c600dec10ae3f232b47e5116213efd52707c6fd","observation_id":"a1b4b04b-df50-42e8-80e0-90881f7afb88","resolution":{"observed_at":"2026-08-08T12:26:16.224011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.227891Z","title":"Improving non-transferable representation learning by harnessing content and style","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.227891Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:3c8e65ff512f1aefddb76f506bebf9dfc0a62e55a75524f5b71ad9a67bd0f617","observation_id":"eb4e7ecf-fb42-4650-97d3-3089b52c5353","resolution":{"observed_at":"2026-08-08T12:26:16.227891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.231597Z","title":"Densely connected convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.231597Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:cce96f613476b8420517482b2e7f5e51381a65b0fc86f53221a7d834d37c4e41","observation_id":"93f9f451-49fb-4039-9b38-7c69de252e6a","resolution":{"observed_at":"2026-08-08T12:26:16.231597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.235199Z","title":"Epsilon-coresets for clustering (with outliers) in doubling metrics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.235199Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:343aa706e30a700e181b09462a43cf3971a2f6628f0df494d3851f7cc3d12688","observation_id":"f65376b4-e3ac-4ca4-ab40-d51afeddde97","resolution":{"observed_at":"2026-08-08T12:26:16.235199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.03162","last_updated":"2023-04-08T02:06:26Z","snapshot_observed_at":"2026-07-06T13:28:42.785260Z","submitted_at":"2022-07-07T08:48:59Z","title":"Harnessing Out-Of-Distribution Examples via Augmenting Content and Style","version":2},"cited_work":{"arxiv_id":"2207.03162","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.03162","snapshot_observed_at":"2026-08-08T12:26:16.806682Z","title":"Harnessing Out-Of-Distribution Examples via Augmenting Content and Style","venue":"cs.LG","work_id":"f7cfe89f-5e67-4232-8fe8-c28b029bb44c","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.238855Z"},"links":{"cited_paper":"/paper/2207.03162","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:ed0a02b0ed466d9cc8a1a29d3bec76ca37a9c545fe080c2cd6d80b4bdf1ca278","observation_id":"2b3657bb-155e-4415-b1b6-b95fdd5faf22","resolution":{"observed_at":"2026-08-08T12:26:16.811411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.242828Z","title":"Robust generalization against photon-limited corruptions via worst-case sharpness minimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.242828Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:f1ad06fccb36189260bbd4ee6f72d019ce42a9ecde3f9a4eb42956ce86484794","observation_id":"604d2d0d-149b-471f-aa74-0731026fad21","resolution":{"observed_at":"2026-08-08T12:26:16.242828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.246380Z","title":"Winning prize comes from losing tickets: Improve invariant learning by exploring variant parameters for out-of-distribution generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.246380Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:669c590f4bcd50de28a04fb4d625c6dd5b49957c0a7def2845a5c081b1f2d84d","observation_id":"629c76ef-2194-4fb9-923c-cd5c7ab5b583","resolution":{"observed_at":"2026-08-08T12:26:16.246380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.249894Z","title":"Coresets for scalable bayesian logistic regression","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.249894Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:1200d04b2617ded83f4848406432d6d25067f9e97f7f2d143c96f03eb1a526ca","observation_id":"a5bb0037-7baa-48a0-8df9-4b88c836e179","resolution":{"observed_at":"2026-08-08T12:26:16.249894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08709","last_updated":"2021-03-31T07:22:24Z","snapshot_observed_at":"2026-07-06T08:58:46.539045Z","submitted_at":"2020-02-20T12:50:49Z","title":"Do We Need Zero Training Loss After Achieving Zero Training Error?","version":2},"cited_work":{"arxiv_id":"2002.08709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.08709","snapshot_observed_at":"2026-08-08T12:26:16.789601Z","title":"Do We Need Zero Training Loss After Achieving Zero Training Error?","venue":"cs.LG","work_id":"43a3bff2-dabf-48c2-b52f-3ca3fea730c1","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.253456Z"},"links":{"cited_paper":"/paper/2002.08709","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:dd370efde07e475c4b22cafa3fc3037caa545e67fcf9d972f578dd4ae4f9b44a","observation_id":"bcfaa66e-8d15-4b30-98cf-3f5fd0df6508","resolution":{"observed_at":"2026-08-08T12:26:16.795050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00762","last_updated":"2019-10-02T03:34:29Z","snapshot_observed_at":"2026-08-07T07:17:09.592892Z","submitted_at":"2019-10-02T03:34:29Z","title":"Accelerating Deep Learning by Focusing on the Biggest Losers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00762","snapshot_observed_at":"2026-08-08T12:26:16.257485Z","title":"Accelerating deep learning by focusing on the biggest losers","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.257485Z"},"links":{"cited_paper":"/paper/1910.00762","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:83d0201be4d8aeb776a717e2784f43dc58c59f19b6a229da6b5ca8c023766af7","observation_id":"06c97e87-7ea7-41db-8e80-f661fde2a238","resolution":{"observed_at":"2026-08-08T12:26:16.257485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.460763Z","title":"Mentornet: Learning data-driven curriculum for very deep neural networks on corrupted labels","venue":null,"work_id":"5f7ec253-6c3f-406d-8ae7-1a35394ee7e9","year":2018},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.261378Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:d32602da834885fe67ef58bcad5479de88473b0049c583cab001901c2485e6a0","observation_id":"bcb41cb4-b4ed-4750-a78e-972eb7019027","resolution":{"observed_at":"2026-08-08T12:26:17.464813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T12:26:16.265025Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.265025Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:165a074352bda1b4b52be840d647a61aab4350a6b2d816592792ad79bf2dc8d1","observation_id":"310f8f4c-dba1-4227-acfa-568c04bb8f7b","resolution":{"observed_at":"2026-08-08T12:26:16.265025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.00043","last_updated":"2017-09-13T12:54:33Z","snapshot_observed_at":"2026-08-03T17:24:12.244410Z","submitted_at":"2017-05-31T18:25:09Z","title":"Biased Importance Sampling for Deep Neural Network Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.00043","snapshot_observed_at":"2026-08-08T12:26:16.268782Z","title":"Biased importance sampling for deep neural network training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.268782Z"},"links":{"cited_paper":"/paper/1706.00043","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:2c623e356e2203aa4b8a61eeae2a6d3d3b2153e3f285cfb2abb3673e701c0b2a","observation_id":"0ed83091-7e1d-40ab-ad81-994bea5cec38","resolution":{"observed_at":"2026-08-08T12:26:16.268782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.448723Z","title":"Not all samples are created equal: Deep learning with importance sampling","venue":null,"work_id":"383d3de8-1427-44bd-a545-0e0fcc7e9bda","year":2018},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.273065Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:eb1c385847dc31cc20e47d179369080804f19813885452082fdf39ba5c4dbf88","observation_id":"49ad8f25-69b1-45bf-9bed-5d72f7013bcf","resolution":{"observed_at":"2026-08-08T12:26:17.452730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-08T12:26:16.276790Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.276790Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:812bbcac90f6c0c05ae5152429f4c7c9a196373c92ad008ee179ddc7a37416e9","observation_id":"9b9e0dda-3d9f-42ab-a6c3-77964b0a0c84","resolution":{"observed_at":"2026-08-08T12:26:16.276790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.436235Z","title":"Uniform convergence of rank-weighted learning","venue":null,"work_id":"12a6f766-218a-4c3a-a8f0-6443328add2d","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.280612Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:8ec1573466bda7ba3c1fa2733e9b6d12437cf091e6dcaeac5e0087daa031003f","observation_id":"e4579b8b-28a8-49f7-aaa8-6d84e5ac514a","resolution":{"observed_at":"2026-08-08T12:26:17.440273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.424863Z","title":"Grad-match: Gradient matching based data subset selection for efficient deep model training","venue":null,"work_id":"3e5e2358-e7e0-456d-b83c-402a07d7b509","year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.284138Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:4e1e7b8e1b6dc01920d65c4c2d16fa33552b978893e66cea9631827451a8dccb","observation_id":"e8210d92-d3bc-4aa2-ac50-0d49290a7ced","resolution":{"observed_at":"2026-08-08T12:26:17.428930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.287740Z","title":"Glister: Generalization based data subset selection for efficient and robust learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.287740Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:8201e06e1d8a7e6d58bb6d3091872f406a1447a6421df046e7651c9e8acc4249","observation_id":"7447e734-1bde-4176-a78b-2fc86c0c930f","resolution":{"observed_at":"2026-08-08T12:26:16.287740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:26:16.291458Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.291458Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:3326f6c66e4ec96d7f2827f7e259e50eb06bae07388e78acd48805038b5509b7","observation_id":"98f3422f-c7a7-44f9-8b86-d97536d7d811","resolution":{"observed_at":"2026-08-08T12:26:16.291458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.295039Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.295039Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:30d53131722458de7429a5672b05f2ff7133f9ef0573b2c6bc03a95fc8be57fe","observation_id":"9683d4b2-7572-42d5-836e-7331213e6511","resolution":{"observed_at":"2026-08-08T12:26:16.295039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.400566Z","title":"Self-paced learning for latent variable models","venue":null,"work_id":"a756f61d-17d5-4f4b-beca-a81a242f369c","year":2010},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.298761Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:2fb90c274021c2e93620c95b17fd8af5dcd124f646d20f92afce9726a3f6819d","observation_id":"0d04276f-de90-4bfd-aa94-7e24db2bb57c","resolution":{"observed_at":"2026-08-08T12:26:17.404371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.388349Z","title":"Caltech 101, 2022","venue":null,"work_id":"553e7383-4033-4199-a82d-e837ad4557b5","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.302730Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:dfb9ed3dcd3e42edf95bcda8708f5960917e60c4f0262ba6de2e508e9630cfe9","observation_id":"c4ab8aa4-83ed-4320-94ac-54d713f21185","resolution":{"observed_at":"2026-08-08T12:26:17.392531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.376477Z","title":"Towards realistic model selection for semi-supervised learning","venue":null,"work_id":"7aa50a4a-5a31-41e8-89d0-ef58c4efe1cb","year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.306289Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:322faae7565c9c1b4a031ee5d424036447d1cc7701cb595124934dde9f0a080a","observation_id":"e18b8a1e-1114-4660-900c-e9a4e45d8ba6","resolution":{"observed_at":"2026-08-08T12:26:17.380560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.364611Z","title":"Stochastic modified equations and adaptive stochastic gradient algorithms","venue":null,"work_id":"c07ccd2d-77d9-40bc-be06-20271259396b","year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.309997Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:aac371d4ffff5fa96c4539975e6b4a038ed36f28398023d95cbd17285b0155d4","observation_id":"4d62e6a2-c6ff-449d-bfca-aeaa1a289969","resolution":{"observed_at":"2026-08-08T12:26:17.368633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08659","last_updated":"2023-11-28T16:06:59Z","snapshot_observed_at":"2026-07-06T16:32:11.601334Z","submitted_at":"2023-10-12T18:34:08Z","title":"LoftQ: LoRA-Fine-Tuning-Aware Quantization for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08659","snapshot_observed_at":"2026-08-08T12:26:16.314808Z","title":"Loftq: Lora-fine-tuning-aware quantization for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.314808Z"},"links":{"cited_paper":"/paper/2310.08659","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:1929588a1fac1dea414f7837b6506af1af2fdabf8944cc13aae318938297b953","observation_id":"a3e99755-66b2-4246-b47f-05bdb8fd7346","resolution":{"observed_at":"2026-08-08T12:26:16.314808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02690","last_updated":"2020-08-30T16:50:36Z","snapshot_observed_at":"2026-08-05T05:04:04.733091Z","submitted_at":"2017-06-08T17:43:56Z","title":"Enhancing The Reliability of Out-of-distribution Image Detection in Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02690","snapshot_observed_at":"2026-08-08T12:26:16.318880Z","title":"Enhancing the reliability of out-of-distribution image detection in neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.318880Z"},"links":{"cited_paper":"/paper/1706.02690","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:b59a0a5644b8e45aa2d8a83a307ac9621a1ffa7a0141c7424297fd23b06cb127","observation_id":"8646e34d-009b-4d3a-96b5-5458a7756761","resolution":{"observed_at":"2026-08-08T12:26:16.318880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.351546Z","title":"On the over-memorization during natural, robust and catastrophic overfitting","venue":null,"work_id":"c7318ed8-1261-4af3-b134-779f2512ceea","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.322810Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:c23bcb50fe496a26faab5b3a2a52bcd212856ab4a0c034748f47640f240ff643","observation_id":"4705eb20-3a05-4abe-96ad-687878463417","resolution":{"observed_at":"2026-08-08T12:26:17.356152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16262","last_updated":"2024-09-14T00:25:07Z","snapshot_observed_at":"2026-07-06T18:19:52.121906Z","submitted_at":"2024-05-25T14:56:30Z","title":"Layer-Aware Analysis of Catastrophic Overfitting: Revealing the Pseudo-Robust Shortcut Dependency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16262","snapshot_observed_at":"2026-08-08T12:26:16.326389Z","title":"Layer-aware analysis of catastrophic overfitting: Revealing the pseudo-robust shortcut dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.326389Z"},"links":{"cited_paper":"/paper/2405.16262","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:354a623171f407d00266f6b308ff75baed5ca0c3da1203ee3d56892a0d5facec","observation_id":"a55ca637-413a-4d44-a476-e2878444b7a1","resolution":{"observed_at":"2026-08-08T12:26:16.326389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.338899Z","title":"Eliminating catastrophic overfitting via abnormal adversarial examples regularization","venue":null,"work_id":"fc8ac0bb-3693-4377-a750-66e02d0b7e69","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.330002Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:1b56358e3dfda7ac954222eebcc5282a855b5702ba15a2542c1539f8e440921e","observation_id":"2dd4433f-3c78-4cb8-a17d-27bd97845a66","resolution":{"observed_at":"2026-08-08T12:26:17.343162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.326244Z","title":"Cs-isolate: Extracting hard confident examples by content and style isolation","venue":null,"work_id":"d17abbc5-f9a0-41e5-bd39-bb4d34b1307e","year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.333794Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:c53bff1f2f304d56b20c6680dc91d95928cd607f9f4795fb46ffd7f1d2eeaf8f","observation_id":"06c20fff-11e0-4068-812f-9aca8e2f61af","resolution":{"observed_at":"2026-08-08T12:26:17.330649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.313700Z","title":"Learning the latent causal structure for modeling label noise","venue":null,"work_id":"36e66724-20e7-4c07-af83-b8a1ecdce642","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.337433Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:cc30b07e609fb435c682a8c8f416caf0d4b5cf1a6e14519024d96815ad70cf51","observation_id":"1d6bab42-033a-4b73-a117-c13784992721","resolution":{"observed_at":"2026-08-08T12:26:17.318101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06343","last_updated":"2016-04-25T14:00:21Z","snapshot_observed_at":"2026-08-06T18:58:16.729973Z","submitted_at":"2015-11-19T20:24:09Z","title":"Online Batch Selection for Faster Training of Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06343","snapshot_observed_at":"2026-08-08T12:26:16.340993Z","title":"Online batch selection for faster training of neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.340993Z"},"links":{"cited_paper":"/paper/1511.06343","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:9d9871fae472ab4960fcab5ca533fcaec73b3b6d5503df72f6e352e41c8c756a","observation_id":"0e108370-ccde-47cd-8b07-06b8a525e037","resolution":{"observed_at":"2026-08-08T12:26:16.340993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T12:26:16.344632Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.344632Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:4bcb3d4fbe4d8a8572eff712df5f14df77115a5dde703ddf4fcc2edfbb275112","observation_id":"44f5b713-3f8a-4533-a507-ae77f2fb7e3d","resolution":{"observed_at":"2026-08-08T12:26:16.344632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.301730Z","title":"o ren Mindermann, Jan M Brauner, Muhammed T Razzak, Mrinank Sharma, Andreas Kirsch, Winnie Xu, Benedikt H \\","venue":null,"work_id":"47efec34-9a4c-4faf-9eea-0c876b04177a","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.348417Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:e6b69f0a68c34084e7cc4f422408b727600edfcce0c0fd7a5a2909c6f45fb7fc","observation_id":"4ec730b7-e923-47a3-901f-516999309902","resolution":{"observed_at":"2026-08-08T12:26:17.305822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.289361Z","title":"o sung. ZAMM-Journal of Applied Mathematics and Mechanics/Zeitschrift f \\","venue":null,"work_id":"1c20b40f-3eae-46e7-96de-e792c2ad6a2c","year":1929},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.351827Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:6824eb412116118ebff014bd15a926272a7baa29738076a9f848748b393a3228","observation_id":"658f97fa-f9a2-41a2-95cb-90cf85ca9bbf","resolution":{"observed_at":"2026-08-08T12:26:17.293764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.355549Z","title":"Deep double descent: Where bigger models and more data hurt","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.355549Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:429cc37749960051a0b6647c3bf0dbba9a568c6058c2cb28366fb2ec66085bfc","observation_id":"bc993e4a-9f4c-4c6b-908d-04826110cdad","resolution":{"observed_at":"2026-08-08T12:26:16.355549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.359188Z","title":"Exploring generalization in deep learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.359188Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:c5c01e28700cb02427aa791df1598095029d69b2a026ddf0b2f625d6d20e2fd9","observation_id":"7257081c-295f-4b78-9327-1e1a2eca2d27","resolution":{"observed_at":"2026-08-08T12:26:16.359188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.262107Z","title":"Deep learning on a data diet: Finding important examples early in training","venue":null,"work_id":"54737070-2100-45ed-95ad-84accea50634","year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.363011Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:f82b2812b603d84ff12d7c75c38538bda9943463dc5a30bcd4ef86089ca1fb36","observation_id":"eaaec879-2b9c-46d8-9de7-b3b4acce36f7","resolution":{"observed_at":"2026-08-08T12:26:17.266900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.250156Z","title":"Some methods of speeding up the convergence of iteration methods","venue":null,"work_id":"6452b117-d871-4d68-8876-33821082ff03","year":1964},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.366654Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:2fb288af14c56ca5c4d455e459c6d0bd8362d3ba17eeb16b913c852a0896ff13","observation_id":"da546e06-0393-488b-bde5-6df35e1488bb","resolution":{"observed_at":"2026-08-08T12:26:17.254372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.237886Z","title":"Early stopping-but when? In Neural Networks: Tricks of the trade, pp.\\ 55--69","venue":null,"work_id":"403651e3-39cb-4611-825d-1e84fb391922","year":2002},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.370086Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:3224f1a29abfa919dc43991ecc9b3545511d0b56ad2be7445dd511e36fb829e1","observation_id":"9677783a-737b-4bc6-a7c8-4ac02478f2fa","resolution":{"observed_at":"2026-08-08T12:26:17.242734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04947","last_updated":"2023-10-20T04:38:34Z","snapshot_observed_at":"2026-07-06T15:00:24.620138Z","submitted_at":"2023-03-08T23:40:47Z","title":"InfoBatch: Lossless Training Speed Up by Unbiased Dynamic Data Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04947","snapshot_observed_at":"2026-08-08T12:26:16.373663Z","title":"Infobatch: Lossless training speed up by unbiased dynamic data pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.373663Z"},"links":{"cited_paper":"/paper/2303.04947","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:01b4503ffe0c42ce7b588e9c031bb9c95f45cda206c4515f91ff1f28a42956b8","observation_id":"8421adad-a751-4c78-af0e-5b187f025f60","resolution":{"observed_at":"2026-08-08T12:26:16.373663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12621","last_updated":"2021-11-24T16:47:34Z","snapshot_observed_at":"2026-08-08T00:44:54.701952Z","submitted_at":"2021-11-24T16:47:34Z","title":"Accelerating Deep Learning with Dynamic Data Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12621","snapshot_observed_at":"2026-08-08T12:26:16.377619Z","title":"Accelerating deep learning with dynamic data pruning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.377619Z"},"links":{"cited_paper":"/paper/2111.12621","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:649192d9e40f2dbd677aebf3f3a443e368d2b448fca7a7180d23b9c781a60fe4","observation_id":"d37c84e6-aec6-448b-8477-35f9e1d23efd","resolution":{"observed_at":"2026-08-08T12:26:16.377619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.224605Z","title":"Early stopping and non-parametric regression: an optimal data-dependent stopping rule","venue":null,"work_id":"70cd3eed-ea9a-4291-ad4f-060c137e45d9","year":2014},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.381510Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:d9bd0e1a65fe1a707e68a524a30f0a922875ee4422bf9bc6a4b2f694e8b17def","observation_id":"002392b3-8fa1-4cd4-9f1f-0d41cfa598f4","resolution":{"observed_at":"2026-08-08T12:26:17.228959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-07-06T04:19:53.343717Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-08T12:26:16.385835Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.385835Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:5029e11d1d8e2e9cde9c0a7bac59e3edb151b00bcdb8ec2b084fd5e40b782be3","observation_id":"5f5e2ed1-265a-41b2-8d64-14ef3d068d09","resolution":{"observed_at":"2026-08-08T12:26:16.385835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.212580Z","title":"Overfitting in adversarially robust deep learning","venue":null,"work_id":"e94adabe-969d-4c67-8b6b-0da7c1983048","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.390037Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:a354d4bc5b9268bbc42607f1f11f9bad54ac5c85c35c777f8f112e774c227388","observation_id":"e6e40fe2-bb69-4698-aa27-ef0554216471","resolution":{"observed_at":"2026-08-08T12:26:17.216866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.393977Z","title":"A stochastic approximation method","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.393977Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:49ccf2ab9dd6b88116b42baaa8c01fa15675ea7a7a8a39dbec86bd36398d5d45","observation_id":"b8fd6cc1-b0f0-4be9-80cd-530e12608e08","resolution":{"observed_at":"2026-08-08T12:26:16.393977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.192433Z","title":"An investigation of why overparameterization exacerbates spurious correlations","venue":null,"work_id":"c7cc8ba2-6762-4b11-bbdf-dc0e86324996","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.397322Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:f7e432e9aab3dba5111d9f2f6ca86686f6c687005ec050bf6fb58da559ffc33c","observation_id":"4b321480-faa9-4f4e-9410-12edc7bde2b8","resolution":{"observed_at":"2026-08-08T12:26:17.196860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.178690Z","title":"Data parameters: A new family of parameters for learning a differentiable curriculum","venue":null,"work_id":"bd54b680-03c5-455e-902a-6f6a4ab3da66","year":2019},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.401439Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:714b1de4309b2241344ad407967ddf5506c6cadc68615876bd1b16a605fd845c","observation_id":"613fb2a4-9cd9-42ff-a914-1f346b003ab2","resolution":{"observed_at":"2026-08-08T12:26:17.183441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-08T12:26:16.406337Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.406337Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:d6a5261c51824912686f51ba04ee0efdcd1eb4ac5a7dfa8358fb30a77bce3e25","observation_id":"59bc6b80-2d66-4cb1-a280-24bc65ca1d4b","resolution":{"observed_at":"2026-08-08T12:26:16.406337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13936","last_updated":"2021-04-28T18:00:05Z","snapshot_observed_at":"2026-08-07T12:20:24.837816Z","submitted_at":"2021-04-28T18:00:05Z","title":"Diversity-Aware Batch Active Learning for Dependency Parsing","version":1},"cited_work":{"arxiv_id":"2104.13936","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.13936","snapshot_observed_at":"2026-08-08T12:26:16.630867Z","title":"Diversity-Aware Batch Active Learning for Dependency Parsing","venue":"cs.CL","work_id":"e8962451-8a68-46a0-8799-1d90032cabdb","year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.410294Z"},"links":{"cited_paper":"/paper/2104.13936","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:c2eb78eb33941e56ba331dd2b077e4f3b7df1ff15662b73d1ebe5fe01bba389e","observation_id":"cb3a4bbb-01e0-411b-9ab2-2387bbd01919","resolution":{"observed_at":"2026-08-08T12:26:16.635497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-08T12:26:16.414153Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.414153Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:e081bc84c2474f0de9ffb1d31179f05002b66967f2ec7c4125199eb4244aab98","observation_id":"ed2681d6-1327-409b-b062-aa8b9c15a32f","resolution":{"observed_at":"2026-08-08T12:26:16.414153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.164276Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning","venue":null,"work_id":"5ec07a68-9d11-43a2-afeb-62c34c04d2df","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.418630Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:7b9f44d79ad25fbb1be796d857246f4977440626925cf315268a8c936bcb0a98","observation_id":"ee6519ce-7241-4f1f-8734-74d6d325066e","resolution":{"observed_at":"2026-08-08T12:26:17.168693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.422297Z","title":"Regression shrinkage and selection via the lasso","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.422297Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:18b8ea7af254ba3539f701285e801a88b15e0715007125a12813a5c3106c8ef6","observation_id":"b6150a52-a145-40bb-9200-b4a7ad0ba3be","resolution":{"observed_at":"2026-08-08T12:26:16.422297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05159","last_updated":"2019-11-15T17:08:30Z","snapshot_observed_at":"2026-08-01T06:33:25.731787Z","submitted_at":"2018-12-12T21:24:15Z","title":"An Empirical Study of Example Forgetting during Deep Neural Network Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05159","snapshot_observed_at":"2026-08-08T12:26:16.426997Z","title":"An empirical study of example forgetting during deep neural network learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.426997Z"},"links":{"cited_paper":"/paper/1812.05159","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:be4b35a18bc396d2aaad2dba2a67ad5a2dbfe580677f421548e25c74fb47f565","observation_id":"2698bd54-f74a-49e4-94de-a93ac828b3a8","resolution":{"observed_at":"2026-08-08T12:26:16.426997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.145433Z","title":"Kakurenbo: Adaptively hiding samples in deep neural network training","venue":null,"work_id":"e85e66d3-e781-4ec9-90ed-e02e49869d88","year":2023},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.431126Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:d5c9fd14276d8d57e87a7a06a697f637566d3bd15a5f119ddd08c494ed420e60","observation_id":"883f0432-4377-4bed-a129-a547ef66acd5","resolution":{"observed_at":"2026-08-08T12:26:17.149629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.133284Z","title":"Normalized flat minima: Exploring scale invariant definition of flat minima for neural networks using pac-bayesian analysis","venue":null,"work_id":"2b6062de-7f34-4437-b124-e9ccc4858c6c","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.434865Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:037f2d91b8e63fb40fcdc5f91e8d9056041b2dd66ba3f92370bccc44e97e1517","observation_id":"662f6b12-edcd-49ee-aa1d-a37f878ef558","resolution":{"observed_at":"2026-08-08T12:26:17.137379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.122424Z","title":"Optimizing data usage via differentiable rewards","venue":null,"work_id":"5ee491b7-bd8a-4065-b0b1-492a3b169fb3","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.439118Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:80544a381f7ad441f8879e845a93cbcf53291fbd9c056dbfd95566899cca2573","observation_id":"dd1794ec-8da7-4762-9b37-0961d062a7f2","resolution":{"observed_at":"2026-08-08T12:26:17.126323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.110834Z","title":"Computation-efficient deep learning for computer vision: A survey","venue":null,"work_id":"0170dbcf-e0c0-437c-a634-681e1368c25e","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.443120Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:97be1fb95ef17fbd7469f351ecfbcf21aac662d5bcabb11d8240cd8aed2f1e28","observation_id":"85b13524-9895-4141-b47d-86e1ca356696","resolution":{"observed_at":"2026-08-08T12:26:17.115108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.099227Z","title":"Efficienttrain++: Generalized curriculum learning for efficient visual backbone training","venue":null,"work_id":"ddae6d3f-d0f3-431b-a6a7-d631bab14ebf","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.446928Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:32c0ce94f81d017e4adae6b221680235e83537e0c1983fc6b6f71157b60990f8","observation_id":"0bb0a0b5-6327-42bf-ae7e-05b55b31c5b9","resolution":{"observed_at":"2026-08-08T12:26:17.103369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.05804","last_updated":"2017-09-18T08:07:40Z","snapshot_observed_at":"2026-07-06T06:00:04.065126Z","submitted_at":"2017-09-18T08:07:40Z","title":"Minimal Effort Back Propagation for Convolutional Neural Networks","version":1},"cited_work":{"arxiv_id":"1709.05804","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.05804","snapshot_observed_at":"2026-08-08T12:26:16.593005Z","title":"Minimal Effort Back Propagation for Convolutional Neural Networks","venue":"cs.LG","work_id":"d1c67766-bbad-4a1d-8ee5-ad68361055a8","year":2017},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.450751Z"},"links":{"cited_paper":"/paper/1709.05804","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:a22443e4659e7518ebb1e21bada74ed640c925bba99771c3837a659d1a8c04aa","observation_id":"bedcad5d-82a7-405c-8018-42c7be15a3e3","resolution":{"observed_at":"2026-08-08T12:26:16.597460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.087516Z","title":"Self-filtering: A noise-aware sample selection for label noise with confidence penalization","venue":null,"work_id":"fe767c8d-08b6-4f28-9baa-2f54585c4706","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.454922Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:59a819dcd81f347809cf5f219ef398dff70334efd791d86a6eb345c7deef05a9","observation_id":"0c4afe7b-9da1-4650-a3c0-b58f39906134","resolution":{"observed_at":"2026-08-08T12:26:17.091704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.075580Z","title":"Curriculum learning by transfer learning: Theory and experiments with deep networks","venue":null,"work_id":"e7fac188-5827-40e2-bc4c-3f91d3c0b431","year":2018},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.459765Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:9c3371a63e7804665f906537f85d91dbbb9777ab93c6811c85a29aabd459c501","observation_id":"02903d95-5d02-4914-8010-2ab8a6325105","resolution":{"observed_at":"2026-08-08T12:26:17.079698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00501","last_updated":"2023-04-03T13:32:08Z","snapshot_observed_at":"2026-07-06T13:16:24.921906Z","submitted_at":"2022-06-01T14:00:37Z","title":"Benign Overfitting in Classification: Provably Counter Label Noise with Larger Models","version":2},"cited_work":{"arxiv_id":"2206.00501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00501","snapshot_observed_at":"2026-08-08T12:26:16.572887Z","title":"Benign Overfitting in Classification: Provably Counter Label Noise with Larger Models","venue":"cs.LG","work_id":"b0d0b4cc-455e-4bb0-a9d7-5272f51a9bfa","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.463769Z"},"links":{"cited_paper":"/paper/2206.00501","citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:d05c94e0cbadab4568ebc80200019d76662f6fa0d61bf9d2555dd9c60b31604a","observation_id":"dd9df9f3-525e-413d-a81e-0c89f533f55c","resolution":{"observed_at":"2026-08-08T12:26:16.579418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.064729Z","title":"Sharpness minimization algorithms do not only minimize sharpness to achieve better generalization","venue":null,"work_id":"98500f46-9fd9-40e8-8943-8ae3b95556c5","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.467706Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:b67f17f129785e7aae0218a89fc4f988c72fc511e728f67028f9e1584264993b","observation_id":"1bc7f5ce-70ab-4086-b59c-2c65e02bc2a6","resolution":{"observed_at":"2026-08-08T12:26:17.068545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.054262Z","title":"When do curricula work?, 2021","venue":null,"work_id":"4f453551-f17c-483f-9aa7-04fd3271aa1b","year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.471658Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:828b0003b10e1ebd60f92348bca419180e02d4e57a09415282063ca23a8b6461","observation_id":"48b949b9-a58d-4c5e-97c5-fc01174b4225","resolution":{"observed_at":"2026-08-08T12:26:17.057989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.042226Z","title":"Mitigating label noise on graphs via topological sample selection","venue":null,"work_id":"f64e528f-8d2c-4b95-88d1-6c58706879a2","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.475575Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:692d92e450a60ff92859774d52ee08ffb2b73f92215b6dde55bb084da5d52678","observation_id":"4e150756-43a7-47b3-9bc4-a1e9cc3a00be","resolution":{"observed_at":"2026-08-08T12:26:17.046435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.029235Z","title":"Robust early-learning: Hindering the memorization of noisy labels","venue":null,"work_id":"00b1b7f9-c252-4a68-95c3-6d07290f95fc","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.479050Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:31d891806fb60214ebd78fbead3705b6abb0dd0a5efcc5d212a1efebbef495e7","observation_id":"552c73c2-cff1-4383-b936-9384fa681dbf","resolution":{"observed_at":"2026-08-08T12:26:17.033728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.016920Z","title":"Part-dependent label noise: Towards instance-dependent label noise","venue":null,"work_id":"c8705af1-7ad1-4b40-94f1-61065cde995c","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.483036Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:3dfa83671e77622a3262b16aaab063c8b7d9ffa5406c16bcecce9ec20da0bb82","observation_id":"a69a56fe-5505-4844-989a-982dc0f9df21","resolution":{"observed_at":"2026-08-08T12:26:17.021555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:17.004053Z","title":"Moderate coreset: A universal method of data selection for real-world data-efficient deep learning","venue":null,"work_id":"ebfa10bd-c816-41e0-a119-8baa714dbe01","year":2022},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.486764Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:618086308120a68925503019789ae23caf5ccee92381ebcdfa09e95b30271cc6","observation_id":"032aeb4f-c5fb-47ad-acf4-5e1eb662bb4f","resolution":{"observed_at":"2026-08-08T12:26:17.008732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.991811Z","title":"Refined coreset selection: Towards minimal coreset size under model performance constraints","venue":null,"work_id":"ca9194b8-585c-4329-9c3a-c514a8198109","year":2024},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.490975Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:851500cd23df2b4596dbb23e62bf88bed5fdb12ec0b5f7d4152a91351e5b6470","observation_id":"394f3f0f-cb89-4a2e-a787-275dfd51d9bc","resolution":{"observed_at":"2026-08-08T12:26:16.996100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.978848Z","title":"Rethinking bias-variance trade-off for generalization of neural networks","venue":null,"work_id":"641aa71d-364f-4693-a4bd-1e6fc12123cf","year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.494734Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:e0a0ffd2289203672a7ad8b674aad27d7a84cbec907235a6512f4946fbd50315","observation_id":"ae66dbd2-7ae9-4639-9a31-101ec6ed821b","resolution":{"observed_at":"2026-08-08T12:26:16.983428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.498641Z","title":"Dual t: Reducing estimation error for transition matrix in label-noise learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.498641Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:7136d7d1df0a25183879ae675819199ce647eff9d0e5dd2bd1a0b7f98caeb724","observation_id":"25b13720-49b4-4142-b011-7c625c1d862d","resolution":{"observed_at":"2026-08-08T12:26:16.498641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:26:16.960219Z","title":"Instance-dependent label-noise learning under a structural causal model","venue":null,"work_id":"345c2e5a-330f-4cb4-848a-18c83d1174ea","year":2021},"citing_paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-08T12:26:16.502646Z"},"links":{"citing_paper":"/paper/2502.07547"},"observation_digest":"sha256:2470080893da61e2ef219c7f859dcd4e9a4d8c26db9d7165bab8a6d68f23825d","observation_id":"48ea4d41-8f85-4fdb-9f12-60adc4ba774c","resolution":{"observed_at":"2026-08-08T12:26:16.964748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07547","last_updated":"2025-02-11T13:34:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:19:15.240731Z","submitted_at":"2025-02-11T13:34:09Z","title":"Instance-dependent Early Stopping"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":5,"verified_fuzzy":38},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 0 inbound Pith citation observations for arXiv:2502.07547."}