{"as_of":"2026-08-10T15:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a243ad2d8be72385407739d744f2e44a599158d34a90a7139d2058aa838f9f00","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:24:40.315345Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:17:48.315561Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T06:40:24.869852Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00620","snapshot_observed_at":"2026-08-07T11:17:48.315561Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03109","last_updated":"2025-06-03T17:40:08Z","snapshot_observed_at":"2026-08-08T19:52:36.095174Z","submitted_at":"2025-06-03T17:40:08Z","title":"On Weak-to-Strong Generalization and f-Divergence","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:17:48.315561Z"},"links":{"cited_paper":"/paper/2502.00620","citing_paper":"/paper/2506.03109"},"observation_digest":"sha256:437d8548b2a49161a17202bfffdb5deb145175d0e6a0bd867b71689061e66558","observation_id":"81ec8b57-3f57-4fc3-9cb2-2abcabc0f840","resolution":{"observed_at":"2026-08-07T11:17:48.315561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"cited_work":{"arxiv_id":"2502.00620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00620","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.00620 , year=","venue":null,"work_id":"d09788fa-62c6-47be-8383-02c6aa1a1238","year":null},"citing_paper":{"arxiv_id":"2605.05710","last_updated":"2026-05-07T05:55:10Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:55:10Z","title":"On the Blessing of Pre-training in Weak-to-Strong Generalization","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-08T14:59:19.883399Z"},"links":{"cited_paper":"/paper/2502.00620","citing_paper":"/paper/2605.05710"},"observation_digest":"sha256:db6657c213b671a6d4c3039de61f3641ab23cb3d89701ac590c1c3dde8fb614d","observation_id":"c37234fe-e2f6-4053-b4d1-d3031fd63719","resolution":{"observed_at":"2026-05-11T18:36:08.656531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"cited_work":{"arxiv_id":"2502.00620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00620","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.00620 , year=","venue":null,"work_id":"d09788fa-62c6-47be-8383-02c6aa1a1238","year":null},"citing_paper":{"arxiv_id":"2605.17767","last_updated":"2026-05-21T20:45:44Z","snapshot_observed_at":"2026-08-04T06:32:13.198687Z","submitted_at":"2026-05-18T02:37:50Z","title":"Feature Learning in Linear-Width Two-Layer Networks: Two vs. One Step of Gradient Descent","version":1},"reference_index":251,"source":"arxiv_source","source_observed_at":"2026-05-20T01:29:14.555216Z"},"links":{"cited_paper":"/paper/2502.00620","citing_paper":"/paper/2605.17767"},"observation_digest":"sha256:bc94e82e99f50d35b566cb40035668be5daf063e09c411ea3fc200d98fdfffe0","observation_id":"617ece9a-2073-4d9e-97eb-415f419273d0","resolution":{"observed_at":"2026-05-20T01:32:56.037707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"cited_work":{"arxiv_id":"2502.00620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00620","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.00620 , year=","venue":null,"work_id":"d09788fa-62c6-47be-8383-02c6aa1a1238","year":null},"citing_paper":{"arxiv_id":"2605.17767","last_updated":"2026-05-21T20:45:44Z","snapshot_observed_at":"2026-08-04T06:32:13.198687Z","submitted_at":"2026-05-18T02:37:50Z","title":"Feature Learning in Linear-Width Two-Layer Networks: Two vs. One Step of Gradient Descent","version":2},"reference_index":251,"source":"arxiv_source","source_observed_at":"2026-05-25T06:39:16.246591Z"},"links":{"cited_paper":"/paper/2502.00620","citing_paper":"/paper/2605.17767"},"observation_digest":"sha256:7435c6b98e3bf186bfb360f975a5021c501e276fa766def6537c190d87d7b2ec","observation_id":"4afd1487-5f3f-4501-89b6-27be0b581b78","resolution":{"observed_at":"2026-05-25T06:40:24.872274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00620/citation-record","integrity":"/paper/2502.00620/integrity","json":"/paper/2502.00620/citation-record.json","paper":"/paper/2502.00620"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.041550Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.041550Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:483d3c094074b57be31381d8f0b39db1a705156738da136696378264f44db6a4","observation_id":"b462616d-ad44-4a1a-aff6-d8ddd25d02c4","resolution":{"observed_at":"2026-08-09T18:24:40.041550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.09816","last_updated":"2023-02-15T10:01:31Z","snapshot_observed_at":"2026-08-06T18:01:31.723021Z","submitted_at":"2020-12-17T18:34:45Z","title":"Towards Understanding Ensemble, Knowledge Distillation and Self-Distillation in Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.09816","snapshot_observed_at":"2026-08-09T18:24:40.048724Z","title":"and Li, Y","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.048724Z"},"links":{"cited_paper":"/paper/2012.09816","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:e6dd0f8d75dfc3442bc33533d15891f824dacc5bfb679e753eed2fe49fe289bd","observation_id":"81093135-1811-4529-b77c-43b1a131e698","resolution":{"observed_at":"2026-08-09T18:24:40.048724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.161629Z","title":"Linear algebraic structure of word senses, with applications to polysemy","venue":null,"work_id":"43745d11-32cf-46e9-bafd-9f443fffa1d3","year":2018},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.055073Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:0ceac521817b9e101137227b6380a0274fdfdee70a47d1dc9e6c2a209fa55b91","observation_id":"4e0c71a7-e712-424b-8dfb-9179f7878fa6","resolution":{"observed_at":"2026-08-09T18:24:41.166499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T18:24:40.060426Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.060426Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:9c5a857893f9eaec695c60f7b3b7618e89433a80a3df110150d9a148a39a8482","observation_id":"d16f1899-34a6-4d98-8125-ac42fcb66b36","resolution":{"observed_at":"2026-08-09T18:24:40.060426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.065777Z","title":"L., Long, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.065777Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:a0be9723cbcbeda77f65c635ae60cb1445738f30a2f98f359b005bf7472db4d5","observation_id":"9632c612-9a80-4452-b7c9-8f125fb22add","resolution":{"observed_at":"2026-08-09T18:24:40.065777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.132719Z","title":"H., and Vaucher, A","venue":null,"work_id":"71f6d3a7-7fc7-4241-8c90-beb36d27f915","year":2019},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.070754Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:7e7c28e6c561324445a16eb6a959f9ac90cea08bb0eb004dacb4a9376e0fbc36","observation_id":"e841806f-9535-4fec-bcc0-bebd3ff556d4","resolution":{"observed_at":"2026-08-09T18:24:41.138043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-09T18:24:40.075782Z","title":"H., Baker, B., Gao, L., Aschenbrenner, L., Chen, Y., Ecoffet, A., Joglekar, M., Leike, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.075782Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:003e055e88dc856e5416ca8a22ff7b68b15c0c9032865635e3934b4cd888453e","observation_id":"c0d03f51-3c94-4b44-95ab-959917a2386b","resolution":{"observed_at":"2026-08-09T18:24:40.075782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15116","last_updated":"2024-10-23T03:55:34Z","snapshot_observed_at":"2026-08-10T07:24:01.474234Z","submitted_at":"2024-05-24T00:14:16Z","title":"Quantifying the Gain in Weak-to-Strong Generalization","version":2},"cited_work":{"arxiv_id":"2405.15116","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.15116","snapshot_observed_at":"2026-08-09T18:24:40.654361Z","title":"Quantifying the Gain in Weak-to-Strong Generalization","venue":"cs.LG","work_id":"82717a09-31a3-4ea4-b4a4-18848a63e736","year":2024},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.081312Z"},"links":{"cited_paper":"/paper/2405.15116","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:8a74048e4ac59482acca7732f28f0155ffa8c069b4edcb48a49d3729326e6ada","observation_id":"ad74230c-1c79-4c6c-9cc5-b99f1c8d1c2f","resolution":{"observed_at":"2026-08-09T18:24:40.659856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.4054866","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Chembench: The molecule benchmarks and molmapnet datasets, September 2020","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"cd3ceb56-ebf1-4eb8-a389-c0063e22fd1a","year":2020},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.086688Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:60d4a1dd1217f1aee3f6645feee254740d3a9e682395a5b5efe5b2e8f80d71ca","observation_id":"a8219486-29e3-4cbe-97e3-f770041772fd","resolution":{"observed_at":"2026-08-09T18:24:40.356005Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.115867Z","title":"The componentwise distance to the nearest singular matrix","venue":null,"work_id":"c68cf7b4-7943-40a3-97ac-bb48156b0453","year":1992},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.091556Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:296edc262d3791139505d03eda09bbef441287037f9add315ef891ecc4415aea","observation_id":"028c8671-6201-4a59-ad6a-e23e9dca0d9f","resolution":{"observed_at":"2026-08-09T18:24:41.121024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T18:24:40.096565Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.096565Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:6a51b1ce526a9fac46c29ccc2667d0507804e76d8c2a999181233dfa760540d9","observation_id":"c397b7ad-7487-4e3f-84fb-67de58e25868","resolution":{"observed_at":"2026-08-09T18:24:40.096565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.099862Z","title":"Inversion error, condition number, and approximate inverses of uncertain matrices","venue":null,"work_id":"80303671-612a-4fe4-9207-61205e9232ea","year":2002},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.101186Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:96bc0a5acee38b54dcb148c3dbf626ce07ad6d25cd6d513b6eb18a45a5c4e232","observation_id":"000f19c7-61b6-40ac-932c-060efce2a294","resolution":{"observed_at":"2026-08-09T18:24:41.105152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13230","last_updated":"2020-11-26T10:55:05Z","snapshot_observed_at":"2026-08-09T19:46:49.318806Z","submitted_at":"2020-11-26T10:55:05Z","title":"Molecular representation learning with language models and domain-relevant auxiliary tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13230","snapshot_observed_at":"2026-08-09T18:24:40.105691Z","title":"Molecular representation learning with language models and domain-relevant auxiliary tasks","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.105691Z"},"links":{"cited_paper":"/paper/2011.13230","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:9cb6f8a299b6bdac95e4be9f6ea642306659340f064f799907752aeeb130d057","observation_id":"55afc6d2-6da2-4504-828b-ee2e6d9ba036","resolution":{"observed_at":"2026-08-09T18:24:40.105691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.083160Z","title":"Sparse coding in the primate cortex","venue":null,"work_id":"3901cdf5-5f54-4ba8-b0af-4a27f8d03d24","year":2003},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.111065Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:307b8c3629e5a95973f5316da36134f4451391e6f6f7c5883f8eaa9e40cc70a3","observation_id":"933acca7-7aae-4728-8c53-35a48883042c","resolution":{"observed_at":"2026-08-09T18:24:41.088814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.066275Z","title":"S., and Bartlett, P","venue":null,"work_id":"97f1558c-295e-4530-9f09-7c5e62ee5556","year":2022},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.115801Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:2750db8e05f07508f3cf6747b60eb57f4dedde66e5f0daadb061a1fb8e2cd204","observation_id":"9b673189-e89b-48e8-a6f8-0e23b71e5c67","resolution":{"observed_at":"2026-08-09T18:24:41.071553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02275","last_updated":"2023-02-17T16:08:22Z","snapshot_observed_at":"2026-08-06T11:22:24.347810Z","submitted_at":"2020-08-05T17:59:16Z","title":"Aligning AI With Shared Human Values","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02275","snapshot_observed_at":"2026-08-09T18:24:40.120302Z","title":"Aligning ai with shared human values","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.120302Z"},"links":{"cited_paper":"/paper/2008.02275","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:d2d1d53ae4487ddbbdaa0a5a64faa0cffca499e117100fc7ccc67554718bdb66","observation_id":"b1032421-2515-4eda-9463-d94bfee22c26","resolution":{"observed_at":"2026-08-09T18:24:40.120302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00277","last_updated":"2019-09-06T21:16:16Z","snapshot_observed_at":"2026-07-06T08:18:13.532149Z","submitted_at":"2019-08-31T19:55:44Z","title":"Cosmos QA: Machine Reading Comprehension with Contextual Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00277","snapshot_observed_at":"2026-08-09T18:24:40.125192Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.125192Z"},"links":{"cited_paper":"/paper/1909.00277","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:e67923f632ed6506bd8deea210a34880c77496729f274f80e81b46a4fe781b10","observation_id":"b73fb5d2-99af-4090-b65d-bff01c533fde","resolution":{"observed_at":"2026-08-09T18:24:40.125192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10427","last_updated":"2023-03-23T14:21:02Z","snapshot_observed_at":"2026-08-09T18:03:16.208655Z","submitted_at":"2021-03-18T17:58:02Z","title":"The Low-Rank Simplicity Bias in Deep Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10427","snapshot_observed_at":"2026-08-09T18:24:40.130731Z","title":"The low-rank simplicity bias in deep networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.130731Z"},"links":{"cited_paper":"/paper/2103.10427","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:730d1a4932e26bf1000e11dcb50f6e104999f60ae68c466fac39fb317949c8c2","observation_id":"e2a13334-7098-4e3f-8f88-440dc4349b38","resolution":{"observed_at":"2026-08-09T18:24:40.130731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.136316Z","title":"Neural tangent kernel: Convergence and generalization in neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.136316Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:7955c9164e7826bf4be26d69bcf5881d0dc266615adf1eaff204013d80472b17","observation_id":"930c3bce-778f-47e5-8b3b-fbca1806e725","resolution":{"observed_at":"2026-08-09T18:24:40.136316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.036754Z","title":"Implicit regularization of random feature models","venue":null,"work_id":"ee537cdd-0453-4953-a2a0-41e1c71aa59a","year":2020},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.141054Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:dde5fc52ec893d7850fd82c9e2048c753484f5fe68ece8d48bec8c1d83e2db79","observation_id":"175c0208-7050-4adb-b8bf-bb3d7a761b84","resolution":{"observed_at":"2026-08-09T18:24:41.041732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.020339Z","title":"The power of contrast for feature learning: A theoretical analysis","venue":null,"work_id":"aac8aa80-fcab-4733-96b8-75747a684d1c","year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.145671Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:aeb6708cf1757b40d31c829b95d7bd98d24229cd36350f3f8885eaa8224b81f2","observation_id":"bd51f9ee-b855-4acd-b4d5-d8d2b346a944","resolution":{"observed_at":"2026-08-09T18:24:41.025546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:41.003105Z","title":null,"venue":null,"work_id":"671b108e-aa05-4501-8106-95ae17e8598d","year":2001},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.150324Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:c15697f73502f4a2e4563c52858179694f5eb190f2aaee28cb3c0a1725c03062","observation_id":"36de01a5-e4b6-4387-aab9-d13edc872250","resolution":{"observed_at":"2026-08-09T18:24:41.008495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.986039Z","title":"Sgd on neural networks learns functions of increasing complexity","venue":null,"work_id":"1a74b482-ff4f-49f8-add9-31659ace82ad","year":2019},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.155423Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:e31f745fce9755291ed88521fc81776ddde7e3719099dc0d043e56894d0c033d","observation_id":"024ae0dd-7406-4262-82bd-155bb6a96264","resolution":{"observed_at":"2026-08-09T18:24:40.991131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T18:24:40.160525Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.160525Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:4cc26e7e55b14d3abb4390ba4017f443635f20abdab68d738010afe2004d357f","observation_id":"ad21b0ee-8129-42d9-9c53-8b7c5e20e123","resolution":{"observed_at":"2026-08-09T18:24:40.160525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16043","last_updated":"2024-05-25T03:48:12Z","snapshot_observed_at":"2026-07-31T09:15:59.099560Z","submitted_at":"2024-05-25T03:48:12Z","title":"Theoretical Analysis of Weak-to-Strong Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16043","snapshot_observed_at":"2026-08-09T18:24:40.165710Z","title":"Theoretical analysis of weak-to-strong generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.165710Z"},"links":{"cited_paper":"/paper/2405.16043","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:b6188030edcf89a3281ccaf44cc8fc043130c7e0478e433aecc20b8298fa0c6b","observation_id":"36925be2-4f52-4483-a571-9f7d565d8896","resolution":{"observed_at":"2026-08-09T18:24:40.165710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-09T18:24:40.170795Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.170795Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:ad484b89c89274792e6ec08e29840beed6c2c6a3f8cab4562efe0a9505fc4a4a","observation_id":"092d2ad1-aaf2-4ba1-be18-c7215c1d3855","resolution":{"observed_at":"2026-08-09T18:24:40.170795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.969722Z","title":"Sparse modeling for image and vision processing","venue":null,"work_id":"02423f4e-9e8e-40ec-9ce9-441940962da4","year":2014},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.176916Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:128d342869ea466f4fb7e47509e9580b925fbd351a179ed5290eea0b22ad2441","observation_id":"334e9e4d-706f-4b1c-826f-12b458519408","resolution":{"observed_at":"2026-08-09T18:24:40.975172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.181786Z","title":"A kernel-based view of language model fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.181786Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:c50c4cc0fb894cd612614e6aff0e90d9ba0873780ffeb019ad24e1d2511880c2","observation_id":"4b05e995-c4c0-414b-b0b6-7ebaf251426d","resolution":{"observed_at":"2026-08-09T18:24:40.181786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.941703Z","title":"Benign, tempered, or catastrophic: Toward a refined taxonomy of overfitting","venue":null,"work_id":"305d932e-914a-4137-b5d1-8e76531d3216","year":2022},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.186584Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:21141827d0dfff3b2651ece9f2bc011497c85a8f010bfd4eecfcf24de68b57c9","observation_id":"98db7fd7-19ee-450c-bfa3-f1f0e6340c70","resolution":{"observed_at":"2026-08-09T18:24:40.947282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-09T18:24:40.191377Z","title":"and Tegmark, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.191377Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:6231d73a4de67ab2bd71c53c21daeb3b644ffb6e505f89b7ef23623669a7b700","observation_id":"a4a621db-b73e-4f32-95ed-a358554a4d11","resolution":{"observed_at":"2026-08-09T18:24:40.191377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-07-06T14:04:58.943383Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-09T18:24:40.196486Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.196486Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:31145e4e81f4aedc78cbea5be608a6b11148394191dcf2e0b8e536cfe40c55ff","observation_id":"da335697-5870-4c41-8daf-7a18540c0d96","resolution":{"observed_at":"2026-08-09T18:24:40.196486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.201442Z","title":"Classification vs regression in overparameterized regimes: Does the loss function matter? Journal of Machine Learning Research, 22 0 (222): 0 1--69, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.201442Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:5defd8ad59786e4f16bfa5d3e9a2aed8ee27012cdf39fa449d58d081f26bf8c0","observation_id":"d8dcd912-af51-4c2c-9fc6-4996c6a70fb2","resolution":{"observed_at":"2026-08-09T18:24:40.201442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.914613Z","title":"I., Deng, Z., Ji, W., Zou, J., and Zhang, L","venue":null,"work_id":"0d4ceea6-cf2b-4203-b910-4e8c8024ae7f","year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.206289Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:0f02d8cda43e27337cc9fbc32534c4ca3c41c4f9c27e2e15c735a5b60e88f1d7","observation_id":"11b31c5d-c7bd-4946-bde4-4c942296ed05","resolution":{"observed_at":"2026-08-09T18:24:40.919561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00941","last_updated":"2023-09-07T20:36:48Z","snapshot_observed_at":"2026-08-10T13:52:16.895878Z","submitted_at":"2023-09-02T13:37:34Z","title":"Emergent Linear Representations in World Models of Self-Supervised Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00941","snapshot_observed_at":"2026-08-09T18:24:40.211172Z","title":"Emergent linear representations in world models of self-supervised sequence models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.211172Z"},"links":{"cited_paper":"/paper/2309.00941","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:019a5fa9ad71f9e3c5a1091a6fb0acee1f50414c1c89de664931409bf369a551","observation_id":"c2d7b254-970a-4ac9-94af-cb0d55c4bae7","resolution":{"observed_at":"2026-08-09T18:24:40.211172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.216582Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.216582Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:59f3fedfeea2031f802295a086e7315f040a392d2b8c6a987ec2e37bf61f1f91","observation_id":"c25b341e-f7be-4f8b-9f7f-3719dfc7f894","resolution":{"observed_at":"2026-08-09T18:24:40.216582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.887511Z","title":null,"venue":null,"work_id":"b212024d-5528-4dbb-95b4-6c4696194cb6","year":2004},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.221512Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:d93eba75d95567b9d8ae592902cec86bb5497071ddccb31a0160464232e4897c","observation_id":"530494e7-0eb9-4844-91c2-b2e64ebd1d15","resolution":{"observed_at":"2026-08-09T18:24:40.892507Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.870967Z","title":"Convolutional neural networks analyzed via convolutional sparse coding","venue":null,"work_id":"78e6d326-8d04-486d-9899-56c5bc99cee8","year":2017},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.226461Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:72d2c1928f84cd55b9d937deae6b6ee90246714856c319f21fc89441113de251","observation_id":"ff899ffc-88ba-422b-8688-968b300b3cbf","resolution":{"observed_at":"2026-08-09T18:24:40.876199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.854269Z","title":"Multi-scale feature learning dynamics: Insights for double descent","venue":null,"work_id":"562632e9-d852-4c9d-87e6-2be5106a24d6","year":2022},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.231299Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:3fc62fdc05b2d63a5af8f6d44f549a7a2f873462cd639c03ea20e9c3faa7eb5c","observation_id":"ab786217-e384-4cef-bef9-f5183ecac942","resolution":{"observed_at":"2026-08-09T18:24:40.859485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.236389Z","title":"Data augmentation as feature manipulation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.236389Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:95e24efbdb02c45cb74df8d1f0e0ba0cb4b9138d0ca79665fe61c3665b0b6973","observation_id":"bab086c7-ae2a-4b52-847a-ddf4a823d82b","resolution":{"observed_at":"2026-08-09T18:24:40.236389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03881","last_updated":"2025-03-04T04:28:19Z","snapshot_observed_at":"2026-08-07T20:27:02.371225Z","submitted_at":"2024-12-05T05:29:19Z","title":"Weak-to-Strong Generalization Through the Data-Centric Lens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03881","snapshot_observed_at":"2026-08-09T18:24:40.241318Z","title":"Weak-to-strong generalization through the data-centric lens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.241318Z"},"links":{"cited_paper":"/paper/2412.03881","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:71734c868340cc48f07075afc5135184480feb5c9c6d7c602b74464386cb01f9","observation_id":"6c85c4e4-2567-43ea-984d-0d1bb44a2adc","resolution":{"observed_at":"2026-08-09T18:24:40.241318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16236","last_updated":"2025-03-14T17:08:22Z","snapshot_observed_at":"2026-07-06T18:19:52.121906Z","submitted_at":"2024-05-25T13:54:05Z","title":"A transfer learning framework for weak-to-strong generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16236","snapshot_observed_at":"2026-08-09T18:24:40.246609Z","title":"M., Banerjee, M., Ritov, Y., Yurochkin, M., and Sun, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.246609Z"},"links":{"cited_paper":"/paper/2405.16236","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:caf757e5b4592720a6fc977a2c6c6bd0f8b6f7c6a1da5b9bdf4947c40c5ca52a","observation_id":"297c14f0-ddb1-4270-ad56-e3ea7d5c2825","resolution":{"observed_at":"2026-08-09T18:24:40.246609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.251499Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.251499Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:f2f71c3d4bdfa2c39c1b5d8052f7a2a4d6d90d9800c5e81d02ea69673ae735d1","observation_id":"26bf7187-8367-4a04-8024-d05186dc1a79","resolution":{"observed_at":"2026-08-09T18:24:40.251499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.256688Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.256688Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:8a22917efbfb304456ac81b938e697e10d9327398e27de6614088d991fe3a5b4","observation_id":"0f1b03f0-05b2-4817-aacd-aba2a3f75719","resolution":{"observed_at":"2026-08-09T18:24:40.256688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.261476Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.261476Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:e356970dbe4ee3a488fd53bbe19f10c9cf05a5902b031b51b54d0fdff6e5bb30","observation_id":"f84dcbb6-6df5-404d-9250-399e7e971f9a","resolution":{"observed_at":"2026-08-09T18:24:40.261476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.794373Z","title":"Benign overfitting in multiclass classification: All roads lead to interpolation","venue":null,"work_id":"6e631642-f07b-4e25-9fd4-ee46a164243b","year":2021},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.266443Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:0f1b97fc14d421ec3fb6a3fde78c33cf7588de08d37962dbfb4e362fab20b215","observation_id":"f29dcff4-b6fe-427c-9789-fab2ce9d4f5f","resolution":{"observed_at":"2026-08-09T18:24:40.799525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-09T18:24:40.271220Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.271220Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:1b839b25c52b31013d283b2482c020dac817890666451f1ac9c45953be61237b","observation_id":"6c589006-4449-40c9-9cee-34559cc3eced","resolution":{"observed_at":"2026-08-09T18:24:40.271220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.276258Z","title":"and Li, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.276258Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:3d6d457b9da8a0048c89dc0cdc92fe931ef15d5dca376a9c5d48527884a4ddfa","observation_id":"26cd9012-f95c-4903-801a-c5a24fe36978","resolution":{"observed_at":"2026-08-09T18:24:40.276258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04638","last_updated":"2025-01-31T02:49:11Z","snapshot_observed_at":"2026-08-08T20:24:47.704612Z","submitted_at":"2024-10-06T22:10:50Z","title":"Provable Weak-to-Strong Generalization via Benign Overfitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04638","snapshot_observed_at":"2026-08-09T18:24:40.281155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.281155Z"},"links":{"cited_paper":"/paper/2410.04638","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:5c3629e567dc4010652d1348c3bb07a8d931294c520a800eeabbe8dfe26eaa39","observation_id":"f142382f-0371-44b3-863e-15f50b0331aa","resolution":{"observed_at":"2026-08-09T18:24:40.281155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.286318Z","title":"N., Gomes, J., Geniesse, C., Pappu, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.286318Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:cf5c437931f5d893700edadb927607582670f932218120a0a9b78328c513404c","observation_id":"5c53893f-93af-4937-9dd2-3e5d81eb3b6e","resolution":{"observed_at":"2026-08-09T18:24:40.286318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.756898Z","title":"Which features are learnt by contrastive learning? on the role of simplicity bias in class collapse and feature suppression","venue":null,"work_id":"a31c8c55-d42a-4443-9d80-72c81aca62fb","year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.291185Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:40ea57b2762a5a8633880a4856208a91aeb5cd412694ed17124d34999c9a55de","observation_id":"15fc0df6-1dd4-4def-8923-ae21c344ef35","resolution":{"observed_at":"2026-08-09T18:24:40.762223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.740178Z","title":"Linear spatial pyramid matching using sparse coding for image classification","venue":null,"work_id":"d216e366-1b11-4d8f-9f29-91014ada859a","year":2009},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.296148Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:8b42b2173eeff5fa085feada8f8d8fd3646541b452a327dc5c0583715159c1e5","observation_id":"8fa3d02a-5bc0-41a8-91d1-327831dfa099","resolution":{"observed_at":"2026-08-09T18:24:40.745709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.300748Z","title":"Understanding deep learning (still) requires rethinking generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.300748Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:742f71746e46ca1bc932980ea35cfe5f1d1c54a0b4625710d076f74fc95adb6c","observation_id":"bb96c572-3c08-4c88-8b62-98c184873594","resolution":{"observed_at":"2026-08-09T18:24:40.300748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:24:40.305406Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.305406Z"},"links":{"citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:07102ace8615b750c932db62aab7b6dedb55d7384cc4f1cfa33ebfc40bc24264","observation_id":"14f30af6-0f27-432b-b8af-c0b3a6b3f27f","resolution":{"observed_at":"2026-08-09T18:24:40.305406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-09T18:24:40.310183Z","title":"Representation engineering: A top-down approach to ai transparency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.310183Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:c06800559b6e2d9908b8ea10c1f118ddde036c386f2c4406df501e92bd959d5c","observation_id":"633e648d-a5ff-4f82-aeaf-7abc2948cff5","resolution":{"observed_at":"2026-08-09T18:24:40.310183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11371","last_updated":"2021-08-25T17:58:21Z","snapshot_observed_at":"2026-07-06T11:41:31.540876Z","submitted_at":"2021-08-25T17:58:21Z","title":"Understanding the Generalization of Adam in Learning Neural Networks with Proper Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.11371","snapshot_observed_at":"2026-08-09T18:24:40.315345Z","title":"Understanding the generalization of adam in learning neural networks with proper regularization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T18:24:40.315345Z"},"links":{"cited_paper":"/paper/2108.11371","citing_paper":"/paper/2502.00620"},"observation_digest":"sha256:9983e71cf947579cba5e9dd8b9aa46733b478a6793501f78a19a6e99893ad1a0","observation_id":"a3862328-9605-471c-b4de-0ad06180f3ed","resolution":{"observed_at":"2026-08-09T18:24:40.315345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00620","last_updated":"2025-06-17T22:06:53Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T07:23:26.018142Z","submitted_at":"2025-02-02T01:11:51Z","title":"Representations Shape Weak-to-Strong Generalization: Theoretical Insights and Empirical Predictions"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2502.00620."}