{"as_of":"2026-08-19T04:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b51b497b639cd7b7922b9b09d261c8ef85cee34df6c722f986c886721cb5cb58","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:23:36.717737Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T12:57:26.458109Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T06:07:41.034120Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"cited_work":{"arxiv_id":"2505.07293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07293","snapshot_observed_at":"2026-07-03T06:07:41.034120Z","title":"arXiv preprint arXiv:2505.07293 , year=","venue":null,"work_id":"7a3868f5-8b15-4c67-b0b4-44de5d8c062c","year":null},"citing_paper":{"arxiv_id":"2606.11499","last_updated":"2026-06-09T22:44:47Z","snapshot_observed_at":"2026-08-13T14:10:23.874785Z","submitted_at":"2026-06-09T22:44:47Z","title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T12:57:26.458109Z"},"links":{"cited_paper":"/paper/2505.07293","citing_paper":"/paper/2606.11499"},"observation_digest":"sha256:054cc4f82da39c95fd82b8d522b6cf54868e4cc0eae34341a1e6a8291167cf42","observation_id":"2ea950b2-81b0-4595-bed0-f55952963bc9","resolution":{"observed_at":"2026-07-03T06:07:41.035631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07293/citation-record","integrity":"/paper/2505.07293/integrity","json":"/paper/2505.07293/citation-record.json","paper":"/paper/2505.07293"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02737","last_updated":"2025-02-04T21:43:16Z","snapshot_observed_at":"2026-08-14T05:03:05.661970Z","submitted_at":"2025-02-04T21:43:16Z","title":"SmolLM2: When Smol Goes Big -- Data-Centric Training of a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02737","snapshot_observed_at":"2026-08-15T22:23:35.342892Z","title":"Smollm2: When smol goes big–data-centric training of a small language model.arXiv preprint arXiv:2502.02737, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.342892Z"},"links":{"cited_paper":"/paper/2502.02737","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:003add1d7e942a0310014be5b038d5ccd3f9b10be1ddd6faac05f44c96c8f414","observation_id":"15052427-48b9-41a9-8b25-c77efce244c3","resolution":{"observed_at":"2026-08-15T22:23:35.342892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-08-16T13:47:32.772922Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-15T22:23:35.349667Z","title":"Per- plexed by perplexity: Perplexity-based data pruning with small reference models.arXiv preprintarXiv:2405.20541, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.349667Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:ac74e6fce188cb07435d189b1338a17318a5a8de22f2dbba828cca548c2275fb","observation_id":"569a43c7-96b9-4512-8f85-cdd643740b12","resolution":{"observed_at":"2026-08-15T22:23:35.349667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:35.355299Z","title":"Smollm-corpus,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.355299Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:873a9a94b014da02980782a46b214f36b5972fe3b6dcf45ae84156cbbead27d6","observation_id":"b7ade84b-4b54-4018-a42e-bee1c430bb16","resolution":{"observed_at":"2026-08-15T22:23:35.355299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:35.368664Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.368664Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:369cf13791f0ed0a98ee6b005a311507a2fb7ba583c5d611276a6ede074b0279","observation_id":"2c76a108-f35f-40b1-903f-9d77feff11d3","resolution":{"observed_at":"2026-08-15T22:23:35.368664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:37.686314Z","title":"Towards monoseman- ticity: Decomposing language models with dictionary learning","venue":null,"work_id":"6e1d1ecb-dc63-4ef4-b32e-5b7f9906204b","year":2023},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.376604Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:4d2f07044e2357d5cd465e638494c6158f06824a2ea3050cb3fb1fc5f09f5076","observation_id":"aed61845-245e-47aa-98eb-f335b73c0347","resolution":{"observed_at":"2026-08-15T22:23:37.690423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04807","last_updated":"2020-03-10T15:33:54Z","snapshot_observed_at":"2026-08-17T23:59:15.683084Z","submitted_at":"2020-03-10T15:33:54Z","title":"Efficient Intent Detection with Dual Sentence Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04807","snapshot_observed_at":"2026-08-15T22:23:35.382927Z","title":"Efficient intent detection with dual sentence encoders.arXiv preprint arXiv:2003.04807, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.382927Z"},"links":{"cited_paper":"/paper/2003.04807","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:ff6d9f6b071a3772aed6fe6eafe95b1e2b3a0b60a62779a6fae9f279298c3650","observation_id":"3cf91f5d-d6c8-42ce-925d-e88747df4240","resolution":{"observed_at":"2026-08-15T22:23:35.382927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T22:23:35.471433Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.471433Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:bcc06a786d42c09e6279f25fb821e8fc0682db9a37f442cf803fdc68e8f3cb26","observation_id":"1baea1ab-b71e-4cca-8a05-cd76f6d155e2","resolution":{"observed_at":"2026-08-15T22:23:35.471433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T22:23:35.565205Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.565205Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:52e7d0c8533de18dd14fd9acf542bb90d38440efd018a4aee05abbb091e9671e","observation_id":"c6c97e77-ca05-401c-85fe-9ce465d75f56","resolution":{"observed_at":"2026-08-15T22:23:35.565205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T22:23:35.679161Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.679161Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:12a8f1f1e9e179746538d2260f2b8819ffbe002ed0f1d5645ce013aba46e3403","observation_id":"c64a20fe-1d9e-4398-9eef-1b2ae8502e15","resolution":{"observed_at":"2026-08-15T22:23:35.679161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-08-14T17:09:11.503312Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-15T22:23:35.686363Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs.arXiv preprint arXiv:1903.00161, 2019","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.686363Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:03d38e0752e74041c3776e671230d671989d0ebd716dfb124d926e5daee8ea54","observation_id":"4a00cb4c-a9d6-484b-9a20-5c363045ed9d","resolution":{"observed_at":"2026-08-15T22:23:35.686363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:35.691752Z","title":"Not all heads matter: A head-level kv cache compression method with integrated retrieval and reasoning.arXiv preprint arXiv:2410.19258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.691752Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:2afc03f5217b9ad47c3b065e040d32806928b43cb9ffd0f73c031ccd78ce37d2","observation_id":"b36fbfd1-88ab-4571-8ea4-5434f4336146","resolution":{"observed_at":"2026-08-15T22:23:35.691752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-15T22:23:35.696873Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.696873Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:53d6807cd2bbe7f6346d265ea6c46fdf06feaaed3fbcac00b04f5af81701b231","observation_id":"6a40318b-0c9f-4437-9189-f6318105ea54","resolution":{"observed_at":"2026-08-15T22:23:35.696873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:23:35.701654Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.701654Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:3c6b9f0d2016913b5507460e989ace7df84288de04d83db168433f73dea0f427","observation_id":"7acfe777-81cb-4bb6-a786-6e249ad97c33","resolution":{"observed_at":"2026-08-15T22:23:35.701654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11747","last_updated":"2025-01-23T20:45:47Z","snapshot_observed_at":"2026-08-15T05:34:47.507408Z","submitted_at":"2025-01-20T21:10:22Z","title":"Optimizing Pretraining Data Mixtures with LLM-Estimated Utility","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11747","snapshot_observed_at":"2026-08-15T22:23:35.706278Z","title":"Optimizing pretraining data mixtures with llm-estimated utility.arXiv preprint arXiv:2501.11747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.706278Z"},"links":{"cited_paper":"/paper/2501.11747","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:b38c1a7285311e31d0e97336bfb02e32938363fee18e7e992bf4597e63b560bd","observation_id":"a88aba2a-ac26-4803-9af0-f023b5bd3126","resolution":{"observed_at":"2026-08-15T22:23:35.706278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T22:23:35.755937Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.755937Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:f7062c801112dd0f74cbe79ad270bed41c2ec802010a1812fb8ecd4258d9da8b","observation_id":"536a8b14-8458-4a31-87c7-0ef0a3cb05b5","resolution":{"observed_at":"2026-08-15T22:23:35.755937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T22:23:35.865394Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.865394Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:1326c6922ea026795b84f1f17cc9c62d7c448d77b8203d6837d0f97884c75a86","observation_id":"2d03563a-249c-4f5d-b769-cf0bf78000ac","resolution":{"observed_at":"2026-08-15T22:23:35.865394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T22:23:35.972358Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.972358Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:4713665d53bdb54300d55b687a0d0b8dab653349eb1ca7c6673daedf7fe7b09b","observation_id":"bdc98545-8281-4dcb-b2a6-0c9efa88a7f3","resolution":{"observed_at":"2026-08-15T22:23:35.972358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-15T22:23:35.976986Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.976986Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:de9b4e4fb26319a0805f928a47466e2fa33a6472c7e762d3e4f33086e8513fd0","observation_id":"5cbba9c2-fc87-44cc-907f-07727ec3d6d6","resolution":{"observed_at":"2026-08-15T22:23:35.976986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:35.981579Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.981579Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:338d805f6e1af7a3fe968c28ddb059572e55dc23e70c963c4e9c709018101f55","observation_id":"1306cc60-deb5-40fb-b1bd-9a2b326454ae","resolution":{"observed_at":"2026-08-15T22:23:35.981579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-15T22:23:35.985894Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension.arXiv preprint arXiv:1705.03551, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.985894Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:efa4c678d21f7701439353968431e90357440bb00310370cebedea955f178c19","observation_id":"7624a982-d77e-4261-b3ba-4d94b28278ca","resolution":{"observed_at":"2026-08-15T22:23:35.985894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-08-17T13:59:16.192204Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-15T22:23:35.991918Z","title":"Fasttext","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.991918Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:a833342a21a7fe15f9bb67baf469b42397deff201923ad58e09c0b88af0b4a0e","observation_id":"d18e8cd2-ecdc-4426-a0e5-248831889a75","resolution":{"observed_at":"2026-08-15T22:23:35.991918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:37.663424Z","title":"The mirrored influence hypothesis: Efficient data influence estimation by harnessing forward passes","venue":null,"work_id":"b36de8ce-7062-4e2b-93ba-da66cdb590c9","year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.996508Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:dbd1c483f0e89207739e2755a274f900d7692dd0e02ffaeae842adb6d8a2b7f7","observation_id":"9bce7833-f631-49c4-98fb-4c6689a22566","resolution":{"observed_at":"2026-08-15T22:23:37.667541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-18T01:17:42.874463Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-15T22:23:36.000905Z","title":"Race: Large-scale reading comprehension dataset from examinations, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.000905Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:d5d97a6bb14af23724803a64b054f537ec0b9ba147469a268adfd8ca33a73b8e","observation_id":"305aafe7-e1ab-470a-8712-979f547e8a11","resolution":{"observed_at":"2026-08-15T22:23:36.000905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:36.004896Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.004896Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:8a13266b291530aff63342cff1ac158949c3f3bbb194304afee6e32bb2be12c5","observation_id":"5dbcc96b-45f7-4856-9eec-336deb053f64","resolution":{"observed_at":"2026-08-15T22:23:36.004896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08310","last_updated":"2024-08-15T17:59:30Z","snapshot_observed_at":"2026-08-16T13:26:11.469487Z","submitted_at":"2024-08-15T17:59:30Z","title":"ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08310","snapshot_observed_at":"2026-08-15T22:23:36.012927Z","title":"Scalingfilter: Assessing data quality through inverse utilization of scaling laws.arXiv preprint arXiv:2408.08310, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.012927Z"},"links":{"cited_paper":"/paper/2408.08310","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:2e1c854a02f98773255694da9fe3df4e4039464992066f8483d96f8627591947","observation_id":"4bc5fe5b-f274-4d54-b097-8cebf7207d18","resolution":{"observed_at":"2026-08-15T22:23:36.012927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-16T14:01:38.852778Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-15T22:23:36.017738Z","title":"Rho-1: Not all tokens are what you need.arXiv preprint arXiv:2404.07965, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.017738Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:da134b46466c6e54209b38fbca397cd7eb7e85ce2384959f881b0efb6e8558db","observation_id":"bf3bc0d5-060e-4834-b6ee-e68a1b4bf6a3","resolution":{"observed_at":"2026-08-15T22:23:36.017738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-18T18:58:59.065205Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-15T22:23:36.073298Z","title":"Regmix: Data mixture as regression for language model pre-training.arXiv preprint arXiv:2407.01492, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.073298Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:f14f8648a462147184bb85d23a5d2a12fde768352898da6a6aa7af1686b2269f","observation_id":"163f28b4-f51b-4165-a90c-3ea13af6f64c","resolution":{"observed_at":"2026-08-15T22:23:36.073298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19521","last_updated":"2024-05-24T15:06:45Z","snapshot_observed_at":"2026-08-16T14:05:28.692156Z","submitted_at":"2024-03-28T15:54:59Z","title":"Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19521","snapshot_observed_at":"2026-08-15T22:23:36.181667Z","title":"Interpreting key mechanisms of factual recall in transformer-based language models.arXiv preprint arXiv:2403.19521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.181667Z"},"links":{"cited_paper":"/paper/2403.19521","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:62ba43045b23fdde2024ffee75c111bfc7b70991c17b150afa39c26cbf34e1e7","observation_id":"de5d1edb-5f33-423e-9b9f-477cb03c0a84","resolution":{"observed_at":"2026-08-15T22:23:36.181667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-15T22:23:36.303495Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering.arXiv preprint arXiv:1809.02789, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.303495Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:4c3f3dcb5aae2c45f6ea7fcfd5c74be1a42c757626fc0c16d18697f5964f47cf","observation_id":"d43b5d7a-c0cd-4cb6-b09f-f7d93bb999d9","resolution":{"observed_at":"2026-08-15T22:23:36.303495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-15T22:23:36.309882Z","title":"2 olmo 2 furious.arXiv preprint arXiv:2501.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.309882Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:31b66988cee814bddb2d0a0964ceef0dd9fbf8b72d0bf791bc061be5ccee5159","observation_id":"d5fc0da0-896e-4e02-8ebf-acdffd5c36c4","resolution":{"observed_at":"2026-08-15T22:23:36.309882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-18T21:12:50.808922Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-15T22:23:36.314555Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.314555Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:9be56867178cdf467034764df5e56b57458d398484f6b3c1e662a2cae142b039","observation_id":"d7c0278b-4f75-47d2-bd93-13c13b5b2a1a","resolution":{"observed_at":"2026-08-15T22:23:36.314555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:36.318551Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale.Advancesin Neural Information Processing Systems, 37:30811–30849, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.318551Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:362f3760db9596e89ed5da07559c469e3734f9b9098b90637c174483a40e770c","observation_id":"549d502c-fe53-4c79-8ba9-790de5786f38","resolution":{"observed_at":"2026-08-15T22:23:36.318551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19363","last_updated":"2025-04-08T03:21:10Z","snapshot_observed_at":"2026-08-16T12:54:55.256775Z","submitted_at":"2025-02-26T18:01:19Z","title":"DataMan: Data Manager for Pre-training Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19363","snapshot_observed_at":"2026-08-15T22:23:36.323015Z","title":"Dataman: Data manager for pre-training large language models.arXiv preprint arXiv:2502.19363, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.323015Z"},"links":{"cited_paper":"/paper/2502.19363","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:6e0f95fa7216438ac948b7b69e872f2f77c3280a1a104d3deabe8c34d63d855e","observation_id":"8e477ee4-2df2-4ae2-93ce-7c1326bd5a14","resolution":{"observed_at":"2026-08-15T22:23:36.323015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03514","last_updated":"2024-10-16T08:59:22Z","snapshot_observed_at":"2026-08-18T14:24:43.619068Z","submitted_at":"2024-03-06T07:43:43Z","title":"CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models","version":2},"cited_work":{"arxiv_id":"2403.03514","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.03514","snapshot_observed_at":"2026-08-15T22:23:37.104336Z","title":"CLongEval: A Chinese Benchmark for Evaluating Long-Context Large Language Models","venue":"cs.CL","work_id":"554653bf-1291-4346-b7f3-b82e72848c74","year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.326984Z"},"links":{"cited_paper":"/paper/2403.03514","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:9c9426d09fdae1568ccf56eecdd09c77d19273c8ce88754419018231e5c7d0aa","observation_id":"eccd86e7-1eeb-4d3e-a5d7-efc6425c456b","resolution":{"observed_at":"2026-08-15T22:23:37.109571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-15T22:23:36.331205Z","title":"Scaling language models: Methods, analysis & insights from training gopher.arXiv preprint arXiv:2112.11446, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.331205Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:68199e762fb5f716589bfaedcfe9d834232009d2944a4dbcee166be25850a059","observation_id":"d9e3d4bc-8ec3-44a2-81f5-a5fe463174d9","resolution":{"observed_at":"2026-08-15T22:23:36.331205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T22:23:36.335197Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks.arXiv preprint arXiv:1908.10084, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.335197Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:224b63462282bfc2a22ff368e796ad9d9d13ae96eb61230990eab6afde013408","observation_id":"b1a710f5-84fa-4872-b11f-228ddd6ecf9a","resolution":{"observed_at":"2026-08-15T22:23:36.335197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-15T22:23:36.433043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.433043Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:c6a9a6f7b3c39f59bced20d40061ee615095c5f9d42fac9401dbf08023da6000","observation_id":"e4f4725c-4c7c-4f97-a2d8-ab229eb7892a","resolution":{"observed_at":"2026-08-15T22:23:36.433043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12580","last_updated":"2025-03-06T15:14:17Z","snapshot_observed_at":"2026-08-13T23:45:08.615365Z","submitted_at":"2024-11-19T15:47:12Z","title":"Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12580","snapshot_observed_at":"2026-08-15T22:23:36.485660Z","title":"Procedural knowledge in pretraining drives reasoning in large language models.arXiv preprint arXiv:2411.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.485660Z"},"links":{"cited_paper":"/paper/2411.12580","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:326de08f34d1e103c75ba421c54418d719492a2459f5e58e01a7b45cbd1e5e69","observation_id":"d00461b2-4989-4b1b-bdf6-2e1ae719bfb0","resolution":{"observed_at":"2026-08-15T22:23:36.485660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:36.539919Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.539919Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:806527e80bed8121bc2545dd11ff6eebef23de4db73873ed681ad8a12ced799c","observation_id":"1215aaac-4870-451d-8d1f-5006b754c1fa","resolution":{"observed_at":"2026-08-15T22:23:36.539919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-17T14:00:18.538725Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-08-15T22:23:36.545689Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.545689Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:be459e4ec7c77f2fef552382f40203948732b107512db0471e146a525387bee7","observation_id":"27bba49a-c6ab-4884-8771-3e1f26187e7e","resolution":{"observed_at":"2026-08-15T22:23:36.545689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-15T22:23:36.551402Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them.arXiv preprint arXiv:2210.09261, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.551402Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:4b833f09ff92d7aa6f704411929cf9bbd3db4996be869075641a7a333a909e87","observation_id":"0e8b2492-d185-4735-80b9-9012088498c6","resolution":{"observed_at":"2026-08-15T22:23:36.551402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-14T18:05:06.623407Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-15T22:23:36.556605Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge.arXiv preprint arXiv:1811.00937, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.556605Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:eba0c4df8ae32dbc363d524f8e25718e8dd51360a74da098016cd9e59c8fee83","observation_id":"27ee5e9c-59fb-450c-ae64-9de5435ad704","resolution":{"observed_at":"2026-08-15T22:23:36.556605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T22:23:36.560788Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.560788Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:bd6ce0a5a963734224ac98b99ac3acef46ac5c62d131bd8a8edef70129cf48bf","observation_id":"8038c5c9-bb5e-49fb-8d72-70ff9035f7cf","resolution":{"observed_at":"2026-08-15T22:23:36.560788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:37.626593Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"7bee96bd-8565-4b56-8396-f1a02026121e","year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.565094Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:e3a03d09f15b10ef1745cc4648e5b06a7e087ed96a88da6a1cc8a67e061f83fc","observation_id":"da7a92d6-6bd0-4504-8c55-5d2b3b2cf846","resolution":{"observed_at":"2026-08-15T22:23:37.631020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-16T14:18:25.426536Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-15T22:23:36.569987Z","title":"Qurating: Selecting high-quality data for training language models.arXiv preprint arXiv:2402.09739, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.569987Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:ae037399ca74c0b0f0690c94046f4334c20211075566835fa338d527d62ead64","observation_id":"f5069de9-453b-47c6-9d16-d3e7e0ac01d1","resolution":{"observed_at":"2026-08-15T22:23:36.569987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-14T15:17:42.222016Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-15T22:23:36.576037Z","title":"Organize the web: Constructing domains enhances pre-training data curation.arXiv preprint arXiv:2502.10341, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.576037Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:8426b0dbfe9451ca7d246db8148da0380160f9ffadbdaec16fda026564331664","observation_id":"1648229f-8a32-450f-8ed0-2c1d03f64a6c","resolution":{"observed_at":"2026-08-15T22:23:36.576037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15574","last_updated":"2024-04-24T00:24:03Z","snapshot_observed_at":"2026-08-16T13:58:20.510591Z","submitted_at":"2024-04-24T00:24:03Z","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15574","snapshot_observed_at":"2026-08-15T22:23:36.581532Z","title":"Retrieval head mechanistically explains long-context factuality.arXiv preprint arXiv:2404.15574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.581532Z"},"links":{"cited_paper":"/paper/2404.15574","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:b8112c5df0aa56dc4cf16f34e208d5a8be93278825318ecadd96ac5e1e85ffe6","observation_id":"7d1e7c72-9bd7-49a3-8403-c1dcfea521f5","resolution":{"observed_at":"2026-08-15T22:23:36.581532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:36.585807Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining.Advances in Neural Information Processing Systems, 36:69798–69818, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.585807Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:88a30095ece1e793b0d15d18bc66680b63c39e19ec28877dc5ccae5422bf73fe","observation_id":"c1106b25-412c-4878-b6d7-a6f0c0abe522","resolution":{"observed_at":"2026-08-15T22:23:36.585807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-08-16T14:06:35.643964Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-15T22:23:36.590686Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance.arXiv preprint arXiv:2403.16952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.590686Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:23d5a0812207b64dcc023947ff0958efc2d04d8cfcc4ab71ed4f3228c218fe1c","observation_id":"2105e29b-e248-4728-8d25-f58d390110a2","resolution":{"observed_at":"2026-08-15T22:23:36.590686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:37.603842Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models.Advances in Neural Information Processing Systems, 37:108735–108759, 2024","venue":null,"work_id":"dbd11f24-9177-4c16-b8b3-4d7b66f3a76f","year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.596269Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:56249832321eb3a4ae8863cc3f6f702b281ea26064f00b080dd66a220a44d46c","observation_id":"9088e316-d5e9-46c9-b83e-f793a793c9f1","resolution":{"observed_at":"2026-08-15T22:23:37.608675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-15T22:23:36.600908Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.600908Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:9974a41a410ac8240a7a7bef3642e6bc27f1812d2d59f3f0647ebab656e4760c","observation_id":"727e857c-c636-488d-a5c8-3c70e7a52234","resolution":{"observed_at":"2026-08-15T22:23:36.600908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05639","last_updated":"2024-10-08T02:42:56Z","snapshot_observed_at":"2026-08-16T13:11:41.197156Z","submitted_at":"2024-10-08T02:42:56Z","title":"DecorateLM: Data Engineering through Corpus Rating, Tagging, and Editing with Language Models","version":1},"cited_work":{"arxiv_id":"2410.05639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.05639","snapshot_observed_at":"2026-08-15T22:23:36.888466Z","title":"DecorateLM: Data Engineering through Corpus Rating, Tagging, and Editing with Language Models","venue":"cs.CL","work_id":"d0162a29-fc55-4a6e-9411-04f9c26b30fe","year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.606615Z"},"links":{"cited_paper":"/paper/2410.05639","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:05a2056841c84afe8bf77b0c83b898b47d23b53a12cc82486d0ea2c13f03376c","observation_id":"67b5ae53-835e-4bfe-bd07-633422466e4b","resolution":{"observed_at":"2026-08-15T22:23:36.894507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03752","last_updated":"2024-12-23T17:57:29Z","snapshot_observed_at":"2026-08-18T13:58:15.039437Z","submitted_at":"2024-09-05T17:59:12Z","title":"Attention Heads of Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03752","snapshot_observed_at":"2026-08-15T22:23:36.611340Z","title":"Attention heads of large language models: A survey.arXiv preprint arXiv:2409.03752, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.611340Z"},"links":{"cited_paper":"/paper/2409.03752","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:2bb4a4c7d76075f52c3b150cf19e4f950cd9cdae5f32725398f0284064f20e24","observation_id":"e409344f-83e1-4c8e-b326-ab841ba8882b","resolution":{"observed_at":"2026-08-15T22:23:36.611340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-15T22:23:36.616305Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.616305Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:43f8c99299ebcd5b30b58a12e6c723413c47b66e47d50287cbccb8be34836967","observation_id":"37fdae11-9ece-4c3e-95b9-a05642bae739","resolution":{"observed_at":"2026-08-15T22:23:36.616305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23306","last_updated":"2025-03-30T04:18:28Z","snapshot_observed_at":"2026-08-17T15:19:49.373495Z","submitted_at":"2025-03-30T04:18:28Z","title":"Focus Directions Make Your Language Models Pay More Attention to Relevant Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23306","snapshot_observed_at":"2026-08-15T22:23:36.648696Z","title":"Masked, Retrieval Heads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.648696Z"},"links":{"cited_paper":"/paper/2503.23306","citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:4c9b0a88c8ca49ac39ded46cc45fd0226330d015b342c87507a966916723dc63","observation_id":"8c57fe57-fa0d-4e2a-afdb-205bbbc40cc4","resolution":{"observed_at":"2026-08-15T22:23:36.648696Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1999.77843","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:36.822796Z","title":"\"This is a test string","venue":null,"work_id":"4c536b49-544b-4a2f-abe6-92a3b8285027","year":2017},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.688883Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:42b5a623c5854ed754a0159f832308fa53e002db7d6cccb1fc28c520f53d4c16","observation_id":"d61d900d-6071-44fc-825a-f19e204938d7","resolution":{"observed_at":"2026-08-15T22:23:36.832878Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:37.587715Z","title":"26 Figure 18 The cloud maps of the data selected by AttentionInfluence and FineWeb-Edu Classifier, respectively","venue":null,"work_id":"bb5314de-70a7-41d6-8853-975b7f7381cc","year":null},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:36.717737Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:f69530393de0a5e493e2f1cf13b1dc5a6a78235b136770b1a4c3f359e3b4d351","observation_id":"c016396b-fa74-44e1-822b-b2eef5aba8ad","resolution":{"observed_at":"2026-08-15T22:23:37.593637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:23:35.361541Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T22:23:35.361541Z"},"links":{"citing_paper":"/paper/2505.07293"},"observation_digest":"sha256:96161bc6caaab5ab5bc089678d850ac25ca857615957408bd2f94b160a79f096","observation_id":"6fea8a0a-3d62-4e62-9dbb-15a270189090","resolution":{"observed_at":"2026-08-15T22:23:35.361541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07293","last_updated":"2025-05-12T07:25:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T16:46:36.248842Z","submitted_at":"2025-05-12T07:25:51Z","title":"AttentionInfluence: Adopting Attention Head Influence for Weak-to-Strong Pretraining Data Selection"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2505.07293."}