{"as_of":"2026-08-14T10:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10f49c70fa6f4ca76f886b82a105f25a7dbc1e0f07928e54e37a7ac2a8656553","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:51.114106Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19893/citation-record","integrity":"/paper/2505.19893/integrity","json":"/paper/2505.19893/citation-record.json","paper":"/paper/2505.19893"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-13T04:09:47.874806Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-07T14:09:44.390210Z","title":"M., Longpre, S., Lambert, N., Wang, X., Muennighoff, N., Hou, B., Pan, L., Jeong, H., Raffel, C., Chang, S., Hashimoto, T., and Wang, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.390210Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f4e796b855623af1449a26b12b3de2a28ed475395ff372e30434582f79694d4f","observation_id":"c5e4565a-faa7-4ee1-b74f-98c0c8a8b8f0","resolution":{"observed_at":"2026-08-07T14:09:44.390210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.699283Z","title":null,"venue":null,"work_id":"c5338a76-5945-4488-bdf2-1a18e791561c","year":1999},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.493543Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f4836f4561a82fbf71c81b1796396bd765d25bb87a1eb38c9007166d121c3044","observation_id":"22613bfc-4a69-440c-a367-0dd88544161b","resolution":{"observed_at":"2026-08-07T14:09:57.859226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.547953Z","title":null,"venue":null,"work_id":"c3f81ce3-ecfc-4394-8480-7a8008118382","year":2009},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.602907Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7a740482c6ef521e00f4efd2fd3ffc0e46f2d7d11b47a989c6ad37671ab4f99f","observation_id":"41a33a96-71a8-4589-96cf-cafbfb7f13cb","resolution":{"observed_at":"2026-08-07T14:09:57.617607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.343612Z","title":null,"venue":null,"work_id":"9a27c8cd-f975-4742-b510-e687ee2dd6ce","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.698697Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f51dc131dbfecdafa514f88a077e0a5beb3b5174e72dac6f3f8f3c7cc0e00269","observation_id":"6385af8d-a6d1-45f2-9e05-cfea51f8e003","resolution":{"observed_at":"2026-08-07T14:09:57.436143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.156208Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"9cc0e0c0-4e7b-458e-b379-f25f20a9629b","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.821958Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:115b886856437e1c584745b621ea33e9cce8edc06c4ed81bfd6d133324fa453c","observation_id":"7ccbd500-5237-46e3-b4fc-794627f6b1af","resolution":{"observed_at":"2026-08-07T14:09:57.223478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:57.017303Z","title":null,"venue":null,"work_id":"817d5b47-9491-4697-995c-9cfd0d3b7cda","year":2006},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:44.948297Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:29d6bd34461009c4a8b6efc39df91705df02d74ac905ada83e2ab2b7f92bd90a","observation_id":"f016df29-0942-466c-abcd-bea4ff47626a","resolution":{"observed_at":"2026-08-07T14:09:57.099697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.825303Z","title":null,"venue":null,"work_id":"26c1c4fd-7fcc-448b-9131-10dbb5e6670b","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.043318Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:b3a4ced0edd656501de52ab682f2bbb9e4728eb5e2632b4e88a6173922daba3f","observation_id":"04200d5a-070a-4966-ab4a-f4170eb4c6af","resolution":{"observed_at":"2026-08-07T14:09:56.914899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.680411Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":"7e7a4541-f014-4734-ab05-6202b354fb39","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.094544Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:9d4ca35eadfc628f50af400838009fbbc5d7dfae1f2d88442ab5161acf1e584e","observation_id":"5abf293f-23b7-41ad-801e-d5bc083f1928","resolution":{"observed_at":"2026-08-07T14:09:56.759624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:09:45.215581Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.215581Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7d67c1bcbbf259344e0b7fd0f1c2db50511e4ff96a58d5edc0aeb598a702f14e","observation_id":"84469261-e86d-4aac-a1c0-eb5e97ff0784","resolution":{"observed_at":"2026-08-07T14:09:45.215581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.536680Z","title":null,"venue":null,"work_id":"dc039426-2882-4d9d-bd26-c681a0f1f67c","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.331575Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:255b285fb0765936f50642bf2dea1e99a0d723900c33a7b188c338cd95ab221a","observation_id":"11b824f8-893b-429e-9bcc-ade2347145a8","resolution":{"observed_at":"2026-08-07T14:09:56.580390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.372024Z","title":"Y., Jegelka, S., and Krause, A","venue":null,"work_id":"6e45bf99-eae7-4c9b-b7c9-3a450dc61c61","year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.511080Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:36f78148cddd770d84b22b65d0cc13773e2dce7ae20437d1773c206cce207b4a","observation_id":"6ccd29a6-41ae-4e3d-93d3-daa5aa0ed334","resolution":{"observed_at":"2026-08-07T14:09:56.454906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T14:09:45.618244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.618244Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:195598388c74c786f09cf2be362690010b7aa2d82d890b98296ae57f5e267a73","observation_id":"a3f0f741-599d-4cd8-8ee9-9136b1a2ec0a","resolution":{"observed_at":"2026-08-07T14:09:45.618244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.219096Z","title":"and Namkoong, H","venue":null,"work_id":"f1045caa-1153-4317-937f-3a1b62391c6d","year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.723599Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:023dacd087c7dd39e8ea5962b8224913ca6bf272cba079b80e7e9b9dfe66131d","observation_id":"20c14fee-ce53-41ab-ab0b-a495f8a75a7c","resolution":{"observed_at":"2026-08-07T14:09:56.317730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15389","last_updated":"2023-10-23T22:41:33Z","snapshot_observed_at":"2026-08-13T05:42:40.146586Z","submitted_at":"2023-10-23T22:41:33Z","title":"Irreducible Curriculum for Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15389","snapshot_observed_at":"2026-08-07T14:09:45.871063Z","title":"and Jaggi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.871063Z"},"links":{"cited_paper":"/paper/2310.15389","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:06ef7049804c6c69bc88da2bbcab7e522f5dd4584d579ac61e39c4af1ce29876","observation_id":"0216d8e9-b967-4926-bfba-5ea684dea030","resolution":{"observed_at":"2026-08-07T14:09:45.871063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-13T05:42:40.085088Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-07T14:09:45.950397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:45.950397Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:fa4db22484d2886fc1fb34a0b737c4877fe0e8521d9e49dcab1578426c561d5f","observation_id":"eb274786-b2dd-4323-ac48-42b72e660c48","resolution":{"observed_at":"2026-08-07T14:09:45.950397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:56.104498Z","title":"and Dayan, P","venue":null,"work_id":"3ea51422-8663-421b-bdf3-7f8ac87f52e7","year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.064723Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:753a24560e7e06aa6981858969a6e8334d02e5365dc74ea3ed5d5c357ab59c2c","observation_id":"93504c1f-4915-4a9e-bf7f-2902b47c8450","resolution":{"observed_at":"2026-08-07T14:09:56.154815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.163491Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.163491Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:3bbd0f40b3dbdf4d6a0be89140797698654e673fa889e3fc4ed8fe7870aa2164","observation_id":"3614366c-30a7-4828-934b-cf16d6ae7b00","resolution":{"observed_at":"2026-08-07T14:09:46.163491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.924617Z","title":"and Cohen, V","venue":null,"work_id":"8d5884ca-c98c-4677-8ff1-1d292ebe5cdb","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.335902Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:c8c2969598b762644fc54f803fef07643508e956390ff193abbf77079d9090f9","observation_id":"c51a7a9a-970e-4891-8482-a96b972bd708","resolution":{"observed_at":"2026-08-07T14:09:56.029767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:09:46.458825Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.458825Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:21d4d5380618922117425e3e1d39993ac017c8356b820625b8c0a5970e7608e4","observation_id":"163cdd05-cc9b-4096-b917-be7194f12bd5","resolution":{"observed_at":"2026-08-07T14:09:46.458825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.763577Z","title":"Y., Zhou, T., Wu, Y., Song, X., Song, X., and Zhou, D","venue":null,"work_id":"24f09e7c-5f24-42c4-bb8f-afc28e8779ab","year":2022},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.587696Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a519ed700f6d1159f2b2e4def86185998990cc6f322d674e21dee61b8c3612dc","observation_id":"01b09708-2514-4827-8aed-eeba5c7b2e94","resolution":{"observed_at":"2026-08-07T14:09:55.823606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:46.713461Z","title":"and Waegeman, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.713461Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:8ded370d39dfab254c4db8244e45fbf5a2a440b6a9078a6ab99e35c6497603a9","observation_id":"53d10d34-f94a-47f0-a91e-55cb4955404b","resolution":{"observed_at":"2026-08-07T14:09:46.713461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.568345Z","title":null,"venue":null,"work_id":"ea892409-95ab-4f32-a365-09bbf5d584d8","year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.822031Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:865f176a91bc28bdf3731be6f4a2e4a2661cc643f8bf1085bc61d9750a5d932e","observation_id":"b20dc414-e6ce-4934-bfc4-b9b438aaf92f","resolution":{"observed_at":"2026-08-07T14:09:55.665120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00762","last_updated":"2019-10-02T03:34:29Z","snapshot_observed_at":"2026-08-14T01:39:52.901408Z","submitted_at":"2019-10-02T03:34:29Z","title":"Accelerating Deep Learning by Focusing on the Biggest Losers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00762","snapshot_observed_at":"2026-08-07T14:09:46.918110Z","title":"H., Wong, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:46.918110Z"},"links":{"cited_paper":"/paper/1910.00762","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:1d82ff434e56b4f4170f6b5b30937fff9a494116ab02a87c25cfe312e12e3849","observation_id":"5ed818e2-10a8-43cd-b75e-02687ffcc794","resolution":{"observed_at":"2026-08-07T14:09:46.918110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-07T14:09:47.012470Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.012470Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:62073293d2c7f9dabc54328e9db88713a3eefe5143f95e110ea147460afe46a5","observation_id":"85097b5e-ad96-4b9d-889e-cb1715872737","resolution":{"observed_at":"2026-08-07T14:09:47.012470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:09:47.106847Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.106847Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:a0e35090acdc9dd5878dd9aed523ac309bb08b968ae08a4b0fc15571a13e9704","observation_id":"0a94f43e-7514-4392-9c0c-d167e1717feb","resolution":{"observed_at":"2026-08-07T14:09:47.106847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.383586Z","title":null,"venue":null,"work_id":"4c90a39b-16e7-4873-99f0-dffa4998d133","year":2022},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.274894Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:cff6fb18554b5ba6d5606a891ce97202a2414aeed46629e4addba8fe19a90a4a","observation_id":"b6f1a256-586c-4997-9bac-88b6d80a36fb","resolution":{"observed_at":"2026-08-07T14:09:55.474628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.205904Z","title":"and Fleuret, F","venue":null,"work_id":"8141433e-4584-4336-bd82-c9056328f960","year":2018},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.388011Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f0413128f5922d1007cf577c90265b874ddc437cdf1344a09031e3189d7a0c1b","observation_id":"a39e50b7-01c8-40ed-872f-321d1da91158","resolution":{"observed_at":"2026-08-07T14:09:55.305333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:55.005624Z","title":null,"venue":null,"work_id":"e169cddb-6cb1-4dc8-9cd1-adfc31d24640","year":2021},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.497294Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:83008d50cb81d33a4717e278045983dba5e93444eed224af31779b423f7a2517","observation_id":"7d6b3ba7-5fb1-4090-8fb2-74f628c16113","resolution":{"observed_at":"2026-08-07T14:09:55.101657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.849852Z","title":"and Rush, A","venue":null,"work_id":"5e4dcedb-afac-4713-9e6f-802564796826","year":2016},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.643905Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:cbffa4c6c315b3c7491443bbd64ae2cf55eb3922ed34c4858e81379595d2c147","observation_id":"2b0f463c-7082-4204-bf9b-f3f0b6ff0715","resolution":{"observed_at":"2026-08-07T14:09:54.950509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02549","last_updated":"2025-05-26T19:59:17Z","snapshot_observed_at":"2026-08-12T22:07:53.512849Z","submitted_at":"2024-11-04T19:32:24Z","title":"Distributionally Robust Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02549","snapshot_observed_at":"2026-08-07T14:09:47.837432Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.837432Z"},"links":{"cited_paper":"/paper/2411.02549","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:fd7eadba96b6c2f693c12edfc6229571d6edbc5d5e523b28b7f10d798a670d9e","observation_id":"c4b5ab01-bbb7-4392-9d9b-ba946e937fd5","resolution":{"observed_at":"2026-08-07T14:09:47.837432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-13T06:47:51.509741Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-07T14:09:47.959331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:47.959331Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:c09240f3089e1ed0e42032b56d04369e81b37dfe4b4cc1c3bc81ff9f37c5bf32","observation_id":"e59e25b1-d230-4505-b4dd-5b381d0f9aad","resolution":{"observed_at":"2026-08-07T14:09:47.959331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06343","last_updated":"2016-04-25T14:00:21Z","snapshot_observed_at":"2026-08-12T22:29:07.759658Z","submitted_at":"2015-11-19T20:24:09Z","title":"Online Batch Selection for Faster Training of Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06343","snapshot_observed_at":"2026-08-07T14:09:48.082527Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.082527Z"},"links":{"cited_paper":"/paper/1511.06343","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:5aca7cb62d41300a28dca930cedcd486d113a5c892dcacdb78be0d982e48cb5e","observation_id":"d40f7a1d-b4bb-4e0e-98f7-9b80fde34623","resolution":{"observed_at":"2026-08-07T14:09:48.082527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.688812Z","title":null,"venue":null,"work_id":"352516f3-a5e6-4818-8fcb-59614207c8e2","year":2015},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.197734Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:2e0227fb43635eb7234f75c848ae327f45daa6b60a228583704e7d2fe6d96ec7","observation_id":"0d4dafe6-fe6e-433a-abf7-9a58b36b6db5","resolution":{"observed_at":"2026-08-07T14:09:54.743834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-13T10:17:41.024765Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T14:09:48.284205Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.284205Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:5f1e2b01752eba433e7482a5a44bcf7a2c962c794ed8b89655479ee712afbca4","observation_id":"ea4f463e-8f5a-43cf-a59f-4cf597277efc","resolution":{"observed_at":"2026-08-07T14:09:48.284205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12120","snapshot_observed_at":"2026-08-07T14:09:48.398461Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.398461Z"},"links":{"cited_paper":"/paper/2502.12120","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:fe7937d49602c79282a67c115b72a03011751b24fbab691ee1c28d9b9bdc38cb","observation_id":"7fcf85e1-298e-4c01-8cb1-422e54e41ba0","resolution":{"observed_at":"2026-08-07T14:09:48.398461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-14T07:00:02.529732Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T14:09:48.521179Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.521179Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:0dee096eadea1b706300ee7da78379261bc8e59baa59a5b4016d4d50b36734ff","observation_id":"a08605b6-4ef4-4c92-93e3-f997ae50026e","resolution":{"observed_at":"2026-08-07T14:09:48.521179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.537997Z","title":"M., Razzak, M","venue":null,"work_id":"ced11b2a-f44c-460d-8b17-bd8c84380431","year":2022},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.648493Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f26fab7879920db018c82bfb856d8cfcba02c6a5738b56eae9429b6624fda40c","observation_id":"00e1647d-6d87-4f44-a0c2-21413d663041","resolution":{"observed_at":"2026-08-07T14:09:54.610272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02060","last_updated":"2019-09-04T19:07:33Z","snapshot_observed_at":"2026-08-14T04:58:55.958441Z","submitted_at":"2019-09-04T19:07:33Z","title":"Distributionally Robust Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02060","snapshot_observed_at":"2026-08-07T14:09:48.756530Z","title":"B., and Liang, P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.756530Z"},"links":{"cited_paper":"/paper/1909.02060","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:ceba006c24fd32369146ced842fb8ed36370d2533b03aaaf68495272a524d385","observation_id":"2d482e1e-045c-4946-b5d6-fea337de7d4c","resolution":{"observed_at":"2026-08-07T14:09:48.756530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.384644Z","title":"Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fernandez, R","venue":null,"work_id":"a14c6165-f636-4c0f-ace8-838098cbce76","year":2016},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:48.909920Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:3ef1d629b7c54789e95817224d1f288bea22faa6e473de41d08df55e997085ec","observation_id":"84d475bd-9238-4f02-ae19-0b95e44c49b0","resolution":{"observed_at":"2026-08-07T14:09:54.449216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.244272Z","title":null,"venue":null,"work_id":"450cb7f5-b3d5-4da9-bebf-354f7962d2fa","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.043623Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:04a2b0b0a840900bcc27331e0ec11447b906043a53a900ae642c5f0378fab860","observation_id":"48ae6b37-6f3a-4ac5-af48-a32d7dc34571","resolution":{"observed_at":"2026-08-07T14:09:54.285715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.175622Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.175622Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:307c8f3accb8b5cbc6d358af8d004dbbde05d34c781ff99b071b60f0da006b36","observation_id":"2f9ecefc-1c9e-4d9a-9e06-67ac405c031d","resolution":{"observed_at":"2026-08-07T14:09:49.175622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:54.042740Z","title":null,"venue":null,"work_id":"d8898e9f-4a2d-4e47-ad45-52cad264738a","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.330327Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:1d893136eeef526a3f9b720f88fe57df810b3c4bdc88fabfb9a340cf38a1714a","observation_id":"2d93fa79-547f-4789-a82b-dc4b0615d23d","resolution":{"observed_at":"2026-08-07T14:09:54.132135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18779","last_updated":"2024-10-24T14:31:52Z","snapshot_observed_at":"2026-08-12T22:15:51.824522Z","submitted_at":"2024-10-24T14:31:52Z","title":"A Little Help Goes a Long Way: Efficient LLM Training by Leveraging Small LMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18779","snapshot_observed_at":"2026-08-07T14:09:49.458727Z","title":"S., Sadhanala, V., Rostamizadeh, A., Chakrabarti, A., Jitkrittum, W., Feinberg, V., Kim, S., Harutyunyan, H., Saunshi, N., Nado, Z., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.458727Z"},"links":{"cited_paper":"/paper/2410.18779","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7db659821e8a327116d937d75de3f01d504f2170f387179ca406e89b5525cedc","observation_id":"70e14c5c-ba69-43c5-9b61-afb4f22427b7","resolution":{"observed_at":"2026-08-07T14:09:49.458727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.856832Z","title":null,"venue":null,"work_id":"1d566c2a-4dfc-43d2-b468-b0c9137f761b","year":2002},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.569016Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:6c467980cf3ead324811d7348cf320bf4cb00e5cf2dcf063ff5b514352c2d45c","observation_id":"270d6c88-c103-4b63-bee1-10adb4d7679f","resolution":{"observed_at":"2026-08-07T14:09:53.931666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:49.660065Z","title":"T., Uryasev, S., et al","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.660065Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:f70586b514e93969c165d285eff484ca7bf7e22155df96a2f19876d8db3e1e76","observation_id":"ade882c0-2caf-4109-a564-bdd621b92250","resolution":{"observed_at":"2026-08-07T14:09:49.660065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-13T04:18:39.535968Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T14:09:49.740308Z","title":"H., Caverlee, J., McAuley, J., and Cheng, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.740308Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:9171384abd52842eb58314bc680a58dd9ac832f7b82968b5353b29e1a0ecc711","observation_id":"7be11a93-fc4f-456a-b1ce-c09431db1d5d","resolution":{"observed_at":"2026-08-07T14:09:49.740308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.708236Z","title":null,"venue":null,"work_id":"f4de7697-9b0d-4642-9eb3-d6293d84054c","year":2016},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.807202Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:e33a3c227464a57e1d3f68564a66c93d434e17085ece4de2e5470550fc6ef7e2","observation_id":"85769876-7f40-42db-93e9-6a6007ecca82","resolution":{"observed_at":"2026-08-07T14:09:53.774772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.525345Z","title":null,"venue":null,"work_id":"1719f8df-51d0-411e-98d5-55ca8dbee3c5","year":1948},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.891517Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:db2b93bcee50eb494b1b004fd96f963b867b03f21e31e973b88ed88fd6737701","observation_id":"d6d22732-e402-401b-b4a1-1c824496e6af","resolution":{"observed_at":"2026-08-07T14:09:53.596269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.409060Z","title":"R., Hestness, J., and Dey, N","venue":null,"work_id":"691e0aeb-a6ba-47a3-b247-f04b6d5afd5d","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:49.980510Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:b379f90d43f75b0b5c037cdc1ce1a4bb40f037ae12dbd4b61f5df640cda1655e","observation_id":"5bd8cad6-0366-4a12-884c-72c61a5d7d73","resolution":{"observed_at":"2026-08-07T14:09:53.460624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06733","last_updated":"2025-02-10T17:57:15Z","snapshot_observed_at":"2026-08-13T22:03:46.494750Z","submitted_at":"2025-02-10T17:57:15Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2502.06733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06733","snapshot_observed_at":"2026-08-07T14:09:51.295780Z","title":"Dynamic Loss-Based Sample Reweighting for Improved Large Language Model Pretraining","venue":"cs.LG","work_id":"e868ae07-fb4a-474f-a69b-c36e69aa2487","year":2025},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.090492Z"},"links":{"cited_paper":"/paper/2502.06733","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:aa711f2275ec48cf61ea7440cc32b5721d579b12fc21f367903b30479381f90a","observation_id":"457b51ea-2390-4ed0-8f05-fefe992ccef0","resolution":{"observed_at":"2026-08-07T14:09:51.406696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:53.213446Z","title":null,"venue":null,"work_id":"c347a76f-f78b-49a2-8e6d-5cbc2256b20d","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.182360Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:b28272029692db4f7db7c805c46f1021bf630469a5666fac455e09bebb17f9aa","observation_id":"27c94bad-4712-4b5e-b319-730577f541bb","resolution":{"observed_at":"2026-08-07T14:09:53.320047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.991577Z","title":null,"venue":null,"work_id":"bab1b41c-e372-4964-b5c1-058c2c18c2fe","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.257296Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:d99c6659979e5c5db4a4f4b425795df63baf0893ce9baf45ab56d8af76af40d7","observation_id":"4fe5b468-ad36-4369-9851-690c6dd90719","resolution":{"observed_at":"2026-08-07T14:09:53.099622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.858197Z","title":"T., Wu, T., Song, D., Mittal, P., and Jia, R","venue":null,"work_id":"d0c31749-50b0-4f97-99b0-924ff943aab2","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.366434Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:fbb1c287e718c340097fa5b0da2cb77ad265006d86cb5dcd8d23e758760315e0","observation_id":"31b392eb-f669-404e-9718-ca12259c90d1","resolution":{"observed_at":"2026-08-07T14:09:52.930135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-07T14:09:50.466643Z","title":"F., and Gardner, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.466643Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:d54d09e1c2b3488635623aee46c306a74d3955132fc69044f52c0e922089ea2c","observation_id":"b3c893cf-3193-42c0-a86a-28d011a4c289","resolution":{"observed_at":"2026-08-07T14:09:50.466643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.665551Z","title":null,"venue":null,"work_id":"d051a1a2-b317-479a-ad67-e0c391bcf0db","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.566769Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:5d2f6f49a5c33452383da666f05939ccf6674389ea09204e842e5e3aea3f0077","observation_id":"9b377001-9843-44c5-8f08-6186730925c2","resolution":{"observed_at":"2026-08-07T14:09:52.752364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.480140Z","title":"and Menon, A","venue":null,"work_id":"4a9af5be-cdbc-45fb-a53a-c1c790b557a2","year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.667952Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:4571a4ef97e1f4f4777cdf924fe3cff943c53e618083b7f27ff185e1c939cd30","observation_id":"6cdf1910-301f-4cf2-8fa3-950e08d3ead0","resolution":{"observed_at":"2026-08-07T14:09:52.566666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.302811Z","title":null,"venue":null,"work_id":"13c5a762-1d2c-4b92-aaa7-9368f575ae3b","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.756681Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:7bb552a14682b9545d7e065b6ea667d899808f6d84c62d28a2fdab5f8fe340b6","observation_id":"0d5f2cf0-b35a-49d8-8c0c-859f1d51c1b8","resolution":{"observed_at":"2026-08-07T14:09:52.388361Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:52.172371Z","title":"M., Pham, H., Dong, X., Du, N., Liu, H., Lu, Y., Liang, P","venue":null,"work_id":"c9d61c12-6771-4fb2-b919-a8b55070a4b5","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.817490Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:eef0ccc14dd651e6112a79013d3e9d74490a6f10a61e8cbc534711a9392c54f9","observation_id":"02ba56f4-1ed8-4022-b299-a43b1f23055e","resolution":{"observed_at":"2026-08-07T14:09:52.227595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:51.993285Z","title":"M., Santurkar, S., Ma, T., and Liang, P","venue":null,"work_id":"640a1769-b863-47af-ae55-829bfda71bce","year":2023},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:50.936488Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:8ffad3f22a7f68bdc5591a9235bd0bfdb00d293cf1bc478f0bc29b6a90c7acbc","observation_id":"a11d0f2b-811d-4186-bc3f-cf0a2362e079","resolution":{"observed_at":"2026-08-07T14:09:52.067412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:51.796066Z","title":null,"venue":null,"work_id":"eb80f53d-cb70-43a6-962a-0d0ae0ba7bc0","year":2024},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:51.032016Z"},"links":{"citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:4be3b5deef96e82f9bf42d066b6a6f02c4cd9d1a8ddab564d120090cd7c56646","observation_id":"f8237699-5b1f-4ffb-93f9-943734fc649c","resolution":{"observed_at":"2026-08-07T14:09:51.888153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T14:09:51.114106Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:51.114106Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.19893"},"observation_digest":"sha256:e53880e1c28a38c9771b7b92cc00261471bfa01e2113187a5e73a7dad93851a5","observation_id":"dea4ee42-38ff-4b32-9c67-a4b012fa56b0","resolution":{"observed_at":"2026-08-07T14:09:51.114106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19893","last_updated":"2025-05-26T12:23:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T11:16:36.897895Z","submitted_at":"2025-05-26T12:23:26Z","title":"ESLM: Risk-Averse Selective Language Modeling for Efficient Pretraining"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.19893."}