{"as_of":"2026-08-10T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e4e5658de88a0a785f9483dd5f0cf98a9222c4d6ac436fabdb627eca682979b","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:16:15.616086Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:52:11.990088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T23:39:04.471904Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"cited_work":{"arxiv_id":"2510.06048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06048","snapshot_observed_at":"2026-07-03T23:39:04.471904Z","title":"Bliss: A lightweight bilevel influence scoring method for data selection in language model pretraining","venue":"cs.LG","work_id":"5c711be9-4e0a-447d-b651-e63ca5c7af89","year":2025},"citing_paper":{"arxiv_id":"2605.09404","last_updated":"2026-05-10T08:07:09Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T08:07:09Z","title":"Let the Target Select for Itself: Data Selection via Target-Aligned Paths","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T02:47:55.649231Z"},"links":{"cited_paper":"/paper/2510.06048","citing_paper":"/paper/2605.09404"},"observation_digest":"sha256:3113f656c91db8d8e157672b66f87f9a57fa02deaed6363834ca34d12cbb09b4","observation_id":"a8529f82-f5b4-4e97-aa22-9ebdbaeae50f","resolution":{"observed_at":"2026-06-02T03:04:01.491891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"cited_work":{"arxiv_id":"2510.06048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06048","snapshot_observed_at":"2026-07-03T23:39:04.471904Z","title":"Bliss: A lightweight bilevel influence scoring method for data selection in language model pretraining","venue":"cs.LG","work_id":"5c711be9-4e0a-447d-b651-e63ca5c7af89","year":2025},"citing_paper":{"arxiv_id":"2606.18650","last_updated":"2026-06-17T03:35:04Z","snapshot_observed_at":"2026-07-06T23:54:04.739534Z","submitted_at":"2026-06-17T03:35:04Z","title":"BLADE: Scalable Bi-level Adaptive Data Selection for LLM Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T21:52:11.990088Z"},"links":{"cited_paper":"/paper/2510.06048","citing_paper":"/paper/2606.18650"},"observation_digest":"sha256:eae9d35f465df505e074d25861a0a0eaf867a0a4bbb3ae17d135e11c07625daf","observation_id":"ed7cae44-2241-45e7-8ad9-711b34efab79","resolution":{"observed_at":"2026-07-03T23:39:04.474122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.06048/citation-record","integrity":"/paper/2510.06048/integrity","json":"/paper/2510.06048/citation-record.json","paper":"/paper/2510.06048"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:07.198783Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.198783Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8a8a0f3b103683c0274d31dec2555b5ee135814c82db913aed27e44c38832278","observation_id":"757ac659-f1ca-4db5-8858-a7e049df5862","resolution":{"observed_at":"2026-08-04T11:16:07.198783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-04T11:16:07.290510Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.290510Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:f50807ff7fd955cb3ed7799e77a54523f4f4a4027bbcfdc3ee21572aaf9bac77","observation_id":"a578da8f-7bdf-432b-b468-a9c935287318","resolution":{"observed_at":"2026-08-04T11:16:07.290510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:07.466665Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.466665Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:56110261d44f00b1d7e0e5470fec24d7a2ff83c39485cae3a23a59ceb58ea5c3","observation_id":"f91c319a-0584-4889-b92e-e26da5fb40f0","resolution":{"observed_at":"2026-08-04T11:16:07.466665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-04T11:16:07.586316Z","title":"A survey on data selection for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.586316Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:c305a70c3cedc7b772e118d297c5e38312a54a1003efe047a56a5aeb3b2d4f82","observation_id":"4b9b1bc8-d135-40f5-8e9f-22853406526a","resolution":{"observed_at":"2026-08-04T11:16:07.586316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:07.737036Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.737036Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:92feec975577a7c47ca35760083c338c40b42053aaae0502ea2425ab6ed339ce","observation_id":"612a1a84-321c-4826-aeb7-2393e11fff80","resolution":{"observed_at":"2026-08-04T11:16:07.737036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:07.829736Z","title":"Coresets via bilevel optimization for continual learning and streaming","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.829736Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:cf0bb03ea529f40f6d294f34a7c644a4464eb3871cee84a1c3958bdbdc429774","observation_id":"8b58b62a-f9d0-4e13-b4b1-bfb0b55a59ed","resolution":{"observed_at":"2026-08-04T11:16:07.829736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:07.917407Z","title":"Mathematical programs with optimization problems in the constraints","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.917407Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:6028beebd8b93a112836cdabad56243fe53ed8263b83d4e6af9bd8e40e284631","observation_id":"c6b4d9e0-aadf-4253-b802-3838fb7d1bf1","resolution":{"observed_at":"2026-08-04T11:16:07.917407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:07.993881Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.993881Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:1ce10d2f22628b94325c8ed348e71445506e850b6a7c3931187c4f5362cddce0","observation_id":"e5499762-2eb8-4ae9-8831-89975c3dec95","resolution":{"observed_at":"2026-08-04T11:16:07.993881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00712","last_updated":"2026-04-28T06:26:34Z","snapshot_observed_at":"2026-07-06T14:36:45.845182Z","submitted_at":"2023-01-02T15:09:12Z","title":"On Finding Small Hyper-Gradients in Bilevel Optimization: Hardness Results and Improved Analysis","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00712","snapshot_observed_at":"2026-08-04T11:16:08.139209Z","title":"On bilevel optimization without lower-level strong convexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.139209Z"},"links":{"cited_paper":"/paper/2301.00712","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:cbac6e6bacbc615477ede5fcb5d65e261f1167cd267d7b64f05016c76a6e032c","observation_id":"484bad9f-edc7-4a4c-bf07-fa92c45d9e80","resolution":{"observed_at":"2026-08-04T11:16:08.139209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:08.254900Z","title":"Skill-it! a data-driven skills framework for understanding and training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.254900Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:5e4b0553a10db135d9b9f63fbd85992a2de071790dcd003691b9b7b1c983df2b","observation_id":"d2cf0e28-295b-4d38-b74f-477bad2dd297","resolution":{"observed_at":"2026-08-04T11:16:08.254900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:08.328816Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.328816Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:cd8f836c1790d26e9a7cae3d6f027b6f550638f9a8010092df93cd322bcfcb67","observation_id":"11cd19dc-63bc-448f-8106-08030b86b7e9","resolution":{"observed_at":"2026-08-04T11:16:08.328816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-04T11:16:08.389415Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.389415Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:d73da417df6343861e36d00953c72f61665560868dcf8f8bb09ca22faef21025","observation_id":"583aa7e4-0ffc-493f-bbc2-e3070d3830b2","resolution":{"observed_at":"2026-08-04T11:16:08.389415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T11:16:08.507939Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.507939Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:db9fe5a8330338939a35def11f99d9f3342cf6d4d35fb99f91852d4d0309d8d8","observation_id":"d8e9fec0-1c8d-4b2f-9054-ba15b86d1860","resolution":{"observed_at":"2026-08-04T11:16:08.507939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:08.620919Z","title":"Cross-lingual language model pretraining","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.620919Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:b74d7a7c7061ab7f473a4504f3fd5a7403aabb526d5d4d1efe76579a079fc4a0","observation_id":"4cd3fe17-5704-4431-add8-f820d3599e3f","resolution":{"observed_at":"2026-08-04T11:16:08.620919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:08.775307Z","title":"Detection of influential observation in linear regression","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.775307Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:d23357d54f6a180f423c0a6dbd806618659449fd75a53fc32d356797c81640d3","observation_id":"fea525a0-363d-443a-a86a-fe44b8267821","resolution":{"observed_at":"2026-08-04T11:16:08.775307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13409","last_updated":"2024-11-30T10:12:07Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:17:25Z","title":"A framework for bilevel optimization that enables stochastic and global variance reduction algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13409","snapshot_observed_at":"2026-08-04T11:16:08.898405Z","title":"A framework for bilevel optimization that enables stochastic and global variance reduction algorithms","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:08.898405Z"},"links":{"cited_paper":"/paper/2201.13409","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:c86166fb5db00c05fdc4311ed3c85184fce782268f8193f2f3f67dfcccebb418","observation_id":"3c458f30-5197-4433-aa31-d301d2046384","resolution":{"observed_at":"2026-08-04T11:16:08.898405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:09.009434Z","title":"Foundations of bilevel programming","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.009434Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:0bf5dd02f41b16dee260fab54bd3fc644603d086d3359de5fb41e29a63933b9d","observation_id":"7a9eb371-247c-4e9a-b373-2ba21e667274","resolution":{"observed_at":"2026-08-04T11:16:09.009434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:09.064050Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.064050Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:dd7882dd6e4f2a718c79c498ec8b20ff9627ef0cafb323aa0444b686ab89dd59","observation_id":"0f1a3899-b6ee-4242-a4ea-723ae440b09c","resolution":{"observed_at":"2026-08-04T11:16:09.064050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20707","last_updated":"2024-03-05T20:02:31Z","snapshot_observed_at":"2026-08-09T06:57:55.062530Z","submitted_at":"2023-10-31T17:59:38Z","title":"What's In My Big Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20707","snapshot_observed_at":"2026-08-04T11:16:09.166073Z","title":"What's in my big data? arXiv preprint arXiv:2310.20707, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.166073Z"},"links":{"cited_paper":"/paper/2310.20707","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8e24dff47d694cfb4334223cc82caef5e45b7486bb43d087300711f24b1aaee1","observation_id":"5577f47a-9b6c-464b-83d9-3e5e31a6150a","resolution":{"observed_at":"2026-08-04T11:16:09.166073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-08-10T11:00:33.114322Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-04T11:16:09.373454Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.373454Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:65e85384b391676316480809dfc77652166c5e172d8f700b10b61e63756475f2","observation_id":"385ed274-c754-4dbf-865f-e158358dc084","resolution":{"observed_at":"2026-08-04T11:16:09.373454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-09T06:27:27.325450Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-04T11:16:09.547484Z","title":"Doge: Domain reweighting with generalization estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.547484Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:c30f35b103822116d3f3aff0aee7a0b9ea797b248251a846c826d72de2608f51","observation_id":"95db6ff2-39a0-4749-87cb-42cec357cb8d","resolution":{"observed_at":"2026-08-04T11:16:09.547484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:09.725112Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.725112Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:e12da4dbf9fc8b95cc5eb88a55cb893fdf98892140379b717b82d2b283de30c0","observation_id":"fab9202e-8762-42b8-894e-821d03faea58","resolution":{"observed_at":"2026-08-04T11:16:09.725112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:09.831630Z","title":"Bilevel programming for hyperparameter optimization and meta-learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.831630Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:a9d9aa7943147937c491520c7c99f24613c9b537faaf925057712d60b67c0d70","observation_id":"22e51c21-52df-4ba0-94db-a3cd17d4aaa1","resolution":{"observed_at":"2026-08-04T11:16:09.831630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-04T11:16:09.897557Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.897557Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:ed02157260183801b3b9a82132617ade1ece913de73d935e36458e731decf061","observation_id":"4a7aacb3-756c-4252-8666-da69d8dd6140","resolution":{"observed_at":"2026-08-04T11:16:09.897557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:09.953217Z","title":"A framework for few-shot language model evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:09.953217Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:ce48a5d2eff94edd3831b73fd758e497180822db30b9155879f61b60d3117ace","observation_id":"6db1d171-de8c-4738-b852-5447e7072de2","resolution":{"observed_at":"2026-08-04T11:16:09.953217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-07-06T06:22:08.261855Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-08-04T11:16:10.038290Z","title":"Approximation methods for bilevel programming","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.038290Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:fee0137fd4e236081d12708abc901beb37017661d9fd2cf2509406c99261ed03","observation_id":"c92fb97f-847c-4c73-9429-dfac7f273f20","resolution":{"observed_at":"2026-08-04T11:16:10.038290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.112665Z","title":"A nearly optimal single loop algorithm for stochastic bilevel optimization under unbounded smoothness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.112665Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:74bddfda010d35dd61b58c103b5d47c19bf7cd264309cb6504bffbd6792db349","observation_id":"b36dc07a-53c4-45f8-b090-e9c02341bc0f","resolution":{"observed_at":"2026-08-04T11:16:10.112665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.170919Z","title":"Gemini API Additional Terms of Service , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.170919Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:85ca606ecca43bfc920be2363634581b302db889b7894cbc42fcf9aff2aa1036","observation_id":"394a398a-d6f4-44cb-b4f5-0fd97c6f517f","resolution":{"observed_at":"2026-08-04T11:16:10.170919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.243376Z","title":"Bilevel optimization to learn training distributions for language modeling under domain shift","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.243376Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:cd1e227f24d24aff18061ebeaa10b86a4c5e7af3d15438b13af89bac8c40b8cf","observation_id":"d69f1d4b-5867-4d81-9425-00ed39ed48f3","resolution":{"observed_at":"2026-08-04T11:16:10.243376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03397","last_updated":"2023-11-16T11:13:55Z","snapshot_observed_at":"2026-08-05T14:23:55.580194Z","submitted_at":"2022-02-07T18:35:46Z","title":"Bilevel Optimization with a Lower-level Contraction: Optimal Sample Complexity without Warm-start","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03397","snapshot_observed_at":"2026-08-04T11:16:10.395121Z","title":"Bilevel optimization with a lower-level contraction: Optimal sample complexity without warm-start","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.395121Z"},"links":{"cited_paper":"/paper/2202.03397","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:e7ea4598810f04fcec48cba815643535699028deae1679133b11c9e00f93f4e8","observation_id":"eb53289c-46b0-43d5-982a-caa340d00ac7","resolution":{"observed_at":"2026-08-04T11:16:10.395121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.518081Z","title":"The influence curve and its role in robust estimation","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.518081Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:37efe92bae4443722cc1e94b0f36d6ff7d8aa28e1175f3cd597a646721a70b1b","observation_id":"25ad734b-1e6c-458b-82e2-049a21769186","resolution":{"observed_at":"2026-08-04T11:16:10.518081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.648354Z","title":"Bilevel coreset selection in continual learning: A new formulation and algorithm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.648354Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:50ac45f234bae625ace9fe266d733327cef9cee993b75f7d7b043c1c622b48c1","observation_id":"e4fe46b5-e24f-46f0-aacf-0c28a987fa64","resolution":{"observed_at":"2026-08-04T11:16:10.648354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.770782Z","title":"Bilevel optimization under unbounded smoothness: A new algorithm and convergence analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.770782Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:c74bccb9bbaed1dee8c516fb16f89d6ec80a25c6a908432eb240a01ec3ff9606","observation_id":"fbf76c4b-1507-4fee-9be3-5945cc86a8ca","resolution":{"observed_at":"2026-08-04T11:16:10.770782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:10.882152Z","title":"A two-timescale stochastic algorithm framework for bilevel optimization: Complexity analysis and application to actor-critic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:10.882152Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:92825ca634eefda02a19e7a7022988cb4941f08a4817f86d2a19c765eb76b417","observation_id":"33356ee3-c9f4-4e08-95ca-e4c9c4a1fdd9","resolution":{"observed_at":"2026-08-04T11:16:10.882152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-04T11:16:11.019974Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.019974Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:2130439d9cab67384df85bd82e2bc4c4084e22e701cf65930488bc067eea53fa","observation_id":"8024dddc-b54f-4cb2-864e-601478a0236b","resolution":{"observed_at":"2026-08-04T11:16:11.019974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:11.169342Z","title":"Bilevel optimization: Convergence analysis and enhanced design","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.169342Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:fdd1894ae72fcf88d2e567cfc2d29f2e4491822429790bf5416db1d61fb1c437","observation_id":"01ecebe0-efda-4967-aea1-6134d8ac3786","resolution":{"observed_at":"2026-08-04T11:16:11.169342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:11.338546Z","title":"Understanding black-box predictions via influence functions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.338546Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8442bcc69c175f71b8cfd54f67a1f8b3d2f1bc4a58ebc3b74dd1e4f81c290e76","observation_id":"cb693b56-177f-416f-9456-883165b284a6","resolution":{"observed_at":"2026-08-04T11:16:11.338546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:11.471763Z","title":"A fully first-order method for stochastic bilevel optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.471763Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:310c610f129b99043a8a4d1161166e753835f7bf9973f42ed8372ae496e3db23","observation_id":"200bfa40-54c0-4d6f-96a9-e826faa7228c","resolution":{"observed_at":"2026-08-04T11:16:11.471763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:11.628356Z","title":"The bigscience roots corpus: A 1.6 tb composite multilingual dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.628356Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:96a565cd647b9d409060dfa289a52a08f46ca77de685f0fdd28da87a09393134","observation_id":"5ac66b4e-d06d-4a75-9e79-021dd85dee13","resolution":{"observed_at":"2026-08-04T11:16:11.628356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-04T11:16:11.730526Z","title":"Deduplicating training data makes language models better","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.730526Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:b36922bac32e29361999d9ceb6179ab201c06e12c3269080961b85ad6889f1a9","observation_id":"49e28c09-1bff-4788-b92a-0e0126d8752d","resolution":{"observed_at":"2026-08-04T11:16:11.730526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-04T11:16:11.848067Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.848067Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:b57591f4e6b351f10ddb0a5403d023a571520418f2975082664ef722da4f5f2a","observation_id":"7646492c-b6e3-4dec-a8c1-fb7e792237b0","resolution":{"observed_at":"2026-08-04T11:16:11.848067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:11.988541Z","title":"Residuals and influence in regression, 1984","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:11.988541Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:7c9d66aa45e187a8337c609dc0a8ba82410fe3641783b806d22aca416bc0cf2f","observation_id":"e77bd1ec-b3cb-4afa-a9a3-d5cfd4ab5c72","resolution":{"observed_at":"2026-08-04T11:16:11.988541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-04T11:16:12.173969Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:12.173969Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:91b0a73bd5144df0475d76f8be0b204773e731a3f8dafc7c2c35e16dde1f5c8a","observation_id":"a0bf9455-0292-4b0b-9c7c-4acdf9bdf635","resolution":{"observed_at":"2026-08-04T11:16:12.173969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16380","last_updated":"2024-01-29T18:19:08Z","snapshot_observed_at":"2026-08-10T15:59:45.300276Z","submitted_at":"2024-01-29T18:19:08Z","title":"Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16380","snapshot_observed_at":"2026-08-04T11:16:12.298065Z","title":"Rephrasing the web: A recipe for compute and data-efficient language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:12.298065Z"},"links":{"cited_paper":"/paper/2401.16380","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:6defaddae367c0ce2c0d6965192e78a831336b9500af3ba6c6a5cc68d40516f1","observation_id":"9728fc77-56a6-4b02-a71b-7b87c4917d69","resolution":{"observed_at":"2026-08-04T11:16:12.298065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-04T11:16:12.521323Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:12.521323Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:3e8db515f4213fda65b795e93400a9916b9baec6eb02d57aef9e02cca76c16e6","observation_id":"4e02275e-9601-4f4b-9b4a-9e7ccc3af22d","resolution":{"observed_at":"2026-08-04T11:16:12.521323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:12.608221Z","title":"OpenAI Terms of Service , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:12.608221Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:eff2a339d02c519b8289dc43e13958cf5e022f5242d967e1aeac4afe6caaf23d","observation_id":"4c6ceb9c-5037-48bc-8612-1dc07bbe08c3","resolution":{"observed_at":"2026-08-04T11:16:12.608221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02060","last_updated":"2019-09-04T19:07:33Z","snapshot_observed_at":"2026-07-06T08:19:12.871715Z","submitted_at":"2019-09-04T19:07:33Z","title":"Distributionally Robust Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02060","snapshot_observed_at":"2026-08-04T11:16:12.794510Z","title":"Distributionally robust language modeling","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:12.794510Z"},"links":{"cited_paper":"/paper/1909.02060","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:75be3a2ef1a588e418ee1a89f1c18b425afb99cdce8d5eb2f1e05bdb14ad81d9","observation_id":"e265c651-17df-44ac-9465-d07256630e8a","resolution":{"observed_at":"2026-08-04T11:16:12.794510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19976","last_updated":"2025-05-25T05:03:51Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T15:03:08Z","title":"ScaleBiO: Scalable Bilevel Optimization for LLM Data Reweighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19976","snapshot_observed_at":"2026-08-04T11:16:12.954664Z","title":"Scalebio: Scalable bilevel optimization for llm data reweighting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:12.954664Z"},"links":{"cited_paper":"/paper/2406.19976","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:42c655a7363e4e67d19813240647699658a8183400b414675faece42ab458436","observation_id":"f71baf76-dd69-4b5c-9321-8375a3d2a4c4","resolution":{"observed_at":"2026-08-04T11:16:12.954664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14186","last_updated":"2023-04-03T17:37:50Z","snapshot_observed_at":"2026-08-07T22:49:29.096522Z","submitted_at":"2023-03-24T17:56:22Z","title":"TRAK: Attributing Model Behavior at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14186","snapshot_observed_at":"2026-08-04T11:16:13.203783Z","title":"Trak: Attributing model behavior at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.203783Z"},"links":{"cited_paper":"/paper/2303.14186","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:2feac5c08d4ec754ca788ea3e2738e4f736609a146fc5231430f76be9e0dc355","observation_id":"a94bc637-ebd3-4d44-9da7-e1e30e9e8057","resolution":{"observed_at":"2026-08-04T11:16:13.203783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-04T11:16:13.333647Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.333647Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8a9f86239e90f09cd56bfa8de79f3488591918162087d5505cd97220bfb02400","observation_id":"2c0f6a61-9e6e-4bc7-97c6-4e9fc3d3127c","resolution":{"observed_at":"2026-08-04T11:16:13.333647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-04T11:16:13.465682Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.465682Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:4fed8e8915b4c377bd3ccf6b2cbccf3e34a6dbd259e6bdca1d3dc8fc92688568","observation_id":"ba896be6-d485-4032-8624-6ca2cc4ee3c4","resolution":{"observed_at":"2026-08-04T11:16:13.465682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:13.629404Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.629404Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:c400391cbf5f27e27d8ea32a98085f5531f8a56acfa24023c81663f5bf1bda48","observation_id":"12a36c9f-d06d-416a-b29b-9c128d9835a2","resolution":{"observed_at":"2026-08-04T11:16:13.629404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-04T11:16:13.752561Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.752561Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:7cae3cf51d011c16ce5457e3356e9ac0e8d4fad6b486abee3dcc4dcd120749d9","observation_id":"afd5e3b4-d452-4f57-82ba-ceb78ab4cfbc","resolution":{"observed_at":"2026-08-04T11:16:13.752561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:13.875899Z","title":"Distributionally robust neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.875899Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8dea7c4f357cce4fc0f5c1093958aa1b3d7824cfac662fb562d264e887d7ee6e","observation_id":"1379fcf6-0f1d-41f7-bc6f-6b249153bed4","resolution":{"observed_at":"2026-08-04T11:16:13.875899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:13.928783Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:13.928783Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:ab1029e4b5f5584182005d7da01e91c2bbf36852e3b3af76043e217cc9e0381f","observation_id":"4c117711-9e77-492c-a0c2-f07fef609027","resolution":{"observed_at":"2026-08-04T11:16:13.928783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07471","last_updated":"2024-10-11T01:05:22Z","snapshot_observed_at":"2026-08-08T09:07:14.280048Z","submitted_at":"2024-10-09T22:24:22Z","title":"SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07471","snapshot_observed_at":"2026-08-04T11:16:14.039965Z","title":"Seal: Safety-enhanced aligned llm fine-tuning via bilevel data selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.039965Z"},"links":{"cited_paper":"/paper/2410.07471","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:7c0e8b153ab4c037d1049e0c45b9b127ecc61fc63d43ef92276d3d4ab148b649","observation_id":"a596660d-a762-45e5-b50d-ae0096d1f69e","resolution":{"observed_at":"2026-08-04T11:16:14.039965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:14.079094Z","title":"Bi-level finetuning with task-dependent similarity structure for low-resource training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.079094Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:4836bb6ea81811d0d99a174eebdaa7d4ae7cd7076c96bd78d6874d93e148f0b5","observation_id":"4fa88c9f-fd48-48bd-a7fe-96db4088d201","resolution":{"observed_at":"2026-08-04T11:16:14.079094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:14.150775Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.150775Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:b6a5594505db3bbb1995be2411609f8b60ce59bf4fa92d0b8e1977c235271bd2","observation_id":"32a93d2e-98d6-466a-a0ae-9c6bc8ad36df","resolution":{"observed_at":"2026-08-04T11:16:14.150775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:14.247390Z","title":"D4: Improving llm pretraining via document de-duplication and diversification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.247390Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:e0e1ba1c051eca7196e54d6f0c8590aafbc7cb1423e38fc584a84b119edbfda4","observation_id":"f5c07352-53f7-4b0f-9bb9-d873cb3e5ad2","resolution":{"observed_at":"2026-08-04T11:16:14.247390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-04T11:16:14.372420Z","title":"Crowdsourcing multiple choice science questions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.372420Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:8cce5e405e52f2131fe7ac36cd3bd111b4a3e5767fc71bd13e727557e24e2af3","observation_id":"298b50c8-98f7-4132-b482-8bdb947bf6a0","resolution":{"observed_at":"2026-08-04T11:16:14.372420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-04T11:16:14.514772Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.514772Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:3b71941910617a015530659a4268afe3530d171f5ebb2db3fc4bd44b95c3c11e","observation_id":"e31f17c5-f02a-4005-8b4d-9c7ae6b0fe08","resolution":{"observed_at":"2026-08-04T11:16:14.514772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-10T11:01:44.308829Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-04T11:16:14.661866Z","title":"Qurating: Selecting high-quality data for training language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.661866Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:4b25a7e61ea6fb820a65c37dd5cf22ce77679dddc199a82f6774e4792922a288","observation_id":"f71f9222-a991-4346-b00f-6b81fd770bdf","resolution":{"observed_at":"2026-08-04T11:16:14.661866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-04T11:16:14.810456Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.810456Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:47e62d10dc58c9dc1477c8fc1cb2f2be81ec706ce1a65ba8bfb27dfb5a1d226e","observation_id":"31c7523f-c90b-4089-9984-eb0b5fc3b805","resolution":{"observed_at":"2026-08-04T11:16:14.810456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-07T17:47:02.067367Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-04T11:16:14.978521Z","title":"Less: Selecting influential data for targeted instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:14.978521Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:622103e0a494852b863ffda71971f8e62ff9695fbf16a0c20850ad259ad72087","observation_id":"a3b348a0-105a-462f-b5a8-f6b9c5595c07","resolution":{"observed_at":"2026-08-04T11:16:14.978521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:15.069374Z","title":"Doremi: Optimizing data mixtures speeds up language model pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.069374Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:37a404935a745dcf88149301293488b5f8fb9799dab733c1c397364d9660b28c","observation_id":"29d7d1d5-a55e-4fb2-9e6d-d5438fcf7322","resolution":{"observed_at":"2026-08-04T11:16:15.069374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:15.201535Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.201535Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:18f63f4da482777352de7caa869124b206375ad8c82c57dc8e46073959658e6c","observation_id":"f2e6c024-310e-4421-a8fc-e84dc14d8159","resolution":{"observed_at":"2026-08-04T11:16:15.201535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06046","last_updated":"2024-11-16T02:59:22Z","snapshot_observed_at":"2026-08-10T11:02:43.947878Z","submitted_at":"2024-06-10T06:27:42Z","title":"MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06046","snapshot_observed_at":"2026-08-04T11:16:15.281996Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.281996Z"},"links":{"cited_paper":"/paper/2406.06046","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:f4cf070fbbb9ef696c18424a1ff0f82bfe4a14db315164072a9cfde5ad55940c","observation_id":"0ac98bfb-6693-4547-848f-59cec9b21172","resolution":{"observed_at":"2026-08-04T11:16:15.281996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-04T11:16:15.368440Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.368440Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:4f32ed27fb890992ed0006428c356e8d328a6da49d7047d8c9a548e87aa49468","observation_id":"2f41d391-b46f-4a2d-a140-62234a846f0a","resolution":{"observed_at":"2026-08-04T11:16:15.368440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:15.433553Z","title":"Probabilistic bilevel coreset selection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.433553Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:9d3db45d6f9fa5a97b631286f293937efeeddec9d87cfca1328ff9ed0b2b09f2","observation_id":"281e5d82-efa4-4f0b-aadc-0c128dc7dc89","resolution":{"observed_at":"2026-08-04T11:16:15.433553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:15.483111Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.483111Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:f20aaf1573d9773413fdb46bab126a8f3361f9e18c2e6664545c75eed11acd50","observation_id":"0a2e9b1a-ee6f-426c-b8d3-0a146cfca2e8","resolution":{"observed_at":"2026-08-04T11:16:15.483111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:16:15.549337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.549337Z"},"links":{"citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:6fe1287f90f4f2fd7d7e76e004f9acd8a6444eb8a8154102bc588972d7aade64","observation_id":"6c9e1b97-73ec-49ee-9762-1b9f826640a6","resolution":{"observed_at":"2026-08-04T11:16:15.549337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-04T11:16:15.616086Z","title":"Natural language processing of symptoms documented in free-text narratives of electronic health records: a systematic review","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:15.616086Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:41321cc14e15c58c12f5e00379ef02885cfcdf86cb55bd10fb9703bbccbacb99","observation_id":"170a26b8-54f1-4e44-a3f6-62a0fbcef3e1","resolution":{"observed_at":"2026-08-04T11:16:15.616086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":72,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2510.06048."}