{"as_of":"2026-08-21T09:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:554c73e49a6d1a8fbd4c73af96a5aeac443b2089d438db3d8a9cea09a6d7e89a","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:22.360806Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:01:21.521025Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T17:04:56.636609Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"cited_work":{"arxiv_id":"2505.19051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19051","snapshot_observed_at":"2026-06-30T17:04:56.636609Z","title":"Sung Min Park, Kristian Georgiev, Andrew Ilyas, Guillaume Leclerc, and Aleksander Madry","venue":null,"work_id":"18483297-0505-4f6f-a8e0-11b77a75bd6b","year":null},"citing_paper":{"arxiv_id":"2605.21422","last_updated":"2026-06-01T04:58:51Z","snapshot_observed_at":"2026-08-15T13:16:35.532686Z","submitted_at":"2026-05-20T17:15:43Z","title":"PRISM: Preference-Aware Influence Function Based Data Selection Method for Efficient Fine-Tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T17:01:21.521025Z"},"links":{"cited_paper":"/paper/2505.19051","citing_paper":"/paper/2605.21422"},"observation_digest":"sha256:bb24504a9df4af00bf2674f6ba48d11075cad8789a71ab4806378535c1e621b2","observation_id":"ec243924-b070-4a3b-9b1b-9e31b51376e3","resolution":{"observed_at":"2026-06-30T17:04:56.638213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19051/citation-record","integrity":"/paper/2505.19051/integrity","json":"/paper/2505.19051/citation-record.json","paper":"/paper/2505.19051"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04333","last_updated":"2024-06-13T03:42:02Z","snapshot_observed_at":"2026-08-16T14:20:52.583862Z","submitted_at":"2024-02-06T19:18:04Z","title":"LESS: Selecting Influential Data for Targeted Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04333","snapshot_observed_at":"2026-08-07T14:25:17.393085Z","title":"Less: Selecting influential data for targeted instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:17.393085Z"},"links":{"cited_paper":"/paper/2402.04333","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5c88861fe4db83a35fc601c6904009fa99f4acdf61b6f7150ac79c2342df6607","observation_id":"8fbc55e1-4d0d-4961-b324-4f89de4aa9fe","resolution":{"observed_at":"2026-08-07T14:25:17.393085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16208","last_updated":"2025-04-07T18:16:42Z","snapshot_observed_at":"2026-08-18T13:42:22.425136Z","submitted_at":"2024-10-21T17:11:21Z","title":"Compute-Constrained Data Selection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16208","snapshot_observed_at":"2026-08-07T14:25:17.780704Z","title":"Compute-constrained data selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:17.780704Z"},"links":{"cited_paper":"/paper/2410.16208","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4012069677cd444d8137526459568e3cae66f2017824221c01a2e7b216c1a59c","observation_id":"3d6ef85e-3975-4139-be2b-80015db191cc","resolution":{"observed_at":"2026-08-07T14:25:17.780704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00175","last_updated":"2022-05-19T22:49:00Z","snapshot_observed_at":"2026-08-15T19:53:36.074934Z","submitted_at":"2020-05-01T02:01:18Z","title":"Selecting Informative Contexts Improves Language Model Finetuning","version":3},"cited_work":{"arxiv_id":"2005.00175","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.00175","snapshot_observed_at":"2026-08-07T14:25:23.396552Z","title":"Selecting Informative Contexts Improves Language Model Finetuning","venue":"cs.CL","work_id":"f3cfe3a8-8f1c-4ac2-b326-2aa97b00f250","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:17.896261Z"},"links":{"cited_paper":"/paper/2005.00175","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1360724ef83ef53faea15987d65f29e1ec58e663639c1992c7024768e7ccf81c","observation_id":"f876d2a2-41fd-4918-908b-e958932f7cad","resolution":{"observed_at":"2026-08-07T14:25:23.404674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04564","last_updated":"2023-09-08T19:34:05Z","snapshot_observed_at":"2026-08-16T15:02:10.343729Z","submitted_at":"2023-09-08T19:34:05Z","title":"When Less is More: Investigating Data Pruning for Pretraining LLMs at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04564","snapshot_observed_at":"2026-08-07T14:25:18.051571Z","title":"When less is more: Investigating data pruning for pretraining llms at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.051571Z"},"links":{"cited_paper":"/paper/2309.04564","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4277286695960ac305e9030e7083938093eebf5a3a46ac947d66d86f074acc2d","observation_id":"d619e2ab-6886-44f8-9a45-7f500f198bcc","resolution":{"observed_at":"2026-08-07T14:25:18.051571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-08-16T13:47:32.772922Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-07T14:25:18.158554Z","title":"Perplexed by perplexity: Perplexity-based data pruning with small reference models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.158554Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5a8867c54961e4dc0e8b7052a67a869a9b4e668e04c151864482d132e7024ff4","observation_id":"19b78a8c-059c-4d4e-a570-b9b7eac4fa33","resolution":{"observed_at":"2026-08-07T14:25:18.158554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-08-20T03:29:57.884097Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-08-07T14:25:18.225316Z","title":"From quantity to quality: Boosting llm performance with self-guided data selection for instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.225316Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:8aef4a604aebaf9bb4f7391c32c3c38c405ad94b99bcdd52c881660eb61834c5","observation_id":"21e7f305-db1c-408e-8639-e83c44e0de5f","resolution":{"observed_at":"2026-08-07T14:25:18.225316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01807","last_updated":"2025-06-19T04:19:15Z","snapshot_observed_at":"2026-08-16T12:53:29.192200Z","submitted_at":"2025-03-03T18:37:26Z","title":"Large-Scale Data Selection for Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01807","snapshot_observed_at":"2026-08-07T14:25:18.318477Z","title":"Large-scale data selection for instruction tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.318477Z"},"links":{"cited_paper":"/paper/2503.01807","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5182fc412d4343414c1604a6baf098af1161042ddae6721644df19ad1ab2e1cb","observation_id":"1842ce34-e2e5-4790-8ad3-bdc80f01ace0","resolution":{"observed_at":"2026-08-07T14:25:18.318477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.092650Z","title":"Woodruff, and Michael Wunder","venue":null,"work_id":"96ede5f9-41aa-4517-878f-49e8a04db53d","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.411049Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5393b9f763aad9e86550b46206f4c94471c118c8ec1112a355f96169be7263e1","observation_id":"79ee8196-a446-4fcb-9266-7f377ae89de4","resolution":{"observed_at":"2026-08-07T14:25:24.098253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.072328Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"8cc5da86-d0a4-482e-88a5-e4a3bcbc04be","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.509368Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5f4acfac04b4e9ae4d93f37cff186cde5cc717c57022bf1ffa54fa0de81bfe98","observation_id":"60b8b8ae-e7a5-4c03-bf9d-c1d4aa4238b1","resolution":{"observed_at":"2026-08-07T14:25:24.078640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-08-16T14:25:07.499144Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-08-07T14:25:18.604677Z","title":"Dsdm: Model-aware dataset selection with datamodels, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.604677Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1ac088a73438a1f37abcc7ba99812e640013225d8035356265b548935cfd3829","observation_id":"bb7a900b-430a-47e6-9e52-c239a7a5ec99","resolution":{"observed_at":"2026-08-07T14:25:18.604677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.051526Z","title":"Dynimpt: A dynamic data selection method for improving model training efficiency","venue":null,"work_id":"ce25f67e-d2f8-4138-83bb-711960425dc5","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.700224Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:7b213bfb226675b02324833393cdae21250ba298d6696dad095beae6637c966b","observation_id":"b5eec917-9062-45a4-bfdc-781b790f61e1","resolution":{"observed_at":"2026-08-07T14:25:24.058162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:25:18.771868Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.771868Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:0240675fd4cd997623f1d044835fcfe36f4455e084aa322cc94b960b7b778f78","observation_id":"11e1d17c-c31b-4f87-8cb3-e328be64f6f9","resolution":{"observed_at":"2026-08-07T14:25:18.771868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-18T15:11:49.913463Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-07T14:25:18.851073Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.851073Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:5a298ceee24ca6af9b20a1c71b55836c416fa4b6190570a6305d639886a999a0","observation_id":"0463f96f-69bc-4ecb-a1b0-d5d34f434f28","resolution":{"observed_at":"2026-08-07T14:25:18.851073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:25:18.919852Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:18.919852Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:090877fe277075cf21e90d03a8c03816049de556a761575f398dd069bf9c3fff","observation_id":"f4790058-ee55-4ed6-955b-52cba7aa5027","resolution":{"observed_at":"2026-08-07T14:25:18.919852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.036128Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.036128Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cd242993c3fb55200b6734ac6f25a9d59a2235b1e48a561d2633f2ba78cbc79e","observation_id":"eb35e51a-e430-4238-b334-dcf3b50017d4","resolution":{"observed_at":"2026-08-07T14:25:19.036128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.100480Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.100480Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:ef0baf12b9f0c6eff7f25230e16df70f1d45aafe3d43b40f8980fe2289ac33d5","observation_id":"befea17d-e1d9-4c00-a113-d58a9d298519","resolution":{"observed_at":"2026-08-07T14:25:19.100480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:24.010140Z","title":"Aligning ai with shared human values","venue":null,"work_id":"d879f8c8-61b5-47a5-bde0-910421c998d0","year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.172914Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:3ebb705e13a136e9a15ea28b4ada98c448af9c928a2e1318011e8f1ebad9076b","observation_id":"fcdb9fb3-9c3f-40f1-b9db-e891da515fbe","resolution":{"observed_at":"2026-08-07T14:25:24.015581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.244702Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.244702Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:90255cc273431d5d3a404689ca3b3f5bd6ab69f23d9fe51aa89c415e92fd1c8b","observation_id":"bb3c6ee3-5dc6-4280-99c3-324731caf66f","resolution":{"observed_at":"2026-08-07T14:25:19.244702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-07T14:25:19.312719Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.312719Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:8b2192885a505844169b2112a073a5a09187f05f2e122cca9cdd17c54ba8ba47","observation_id":"d5a8c5d7-e961-4745-875f-389ced08038f","resolution":{"observed_at":"2026-08-07T14:25:19.312719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.977705Z","title":"Cross-lingual transfer learning with data selection for large-scale spoken language understanding","venue":null,"work_id":"94ca2c3b-75b1-416f-85f4-b593903e82bc","year":2019},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.379256Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:66a724f29d42706442d8a124f22cfc844d74ca22d33b492713fe45a1554d633a","observation_id":"88d799a2-6e30-40e3-81b2-49fab40ddd1c","resolution":{"observed_at":"2026-08-07T14:25:23.983540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.955371Z","title":"Smalltolarge (s2l): Scalable data selection for fine-tuning large language models by summarizing training loss trajectories of small models","venue":null,"work_id":"a2c29af2-7e18-47bb-9ce7-6f0e0d8eca4b","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.453517Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d16359ab86edb898eaac14d17d19a677befca454443353733d6535b17520a1fa","observation_id":"a41bb63b-5888-4361-84d8-82c8b50b1045","resolution":{"observed_at":"2026-08-07T14:25:23.965627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T14:25:19.525244Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.525244Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:535295025c222abfcc75153f7694e5af6d223d17734a43cbc384e39e284b8b5e","observation_id":"f361fb2b-cf34-40e7-b9cd-9725d3e3ad4a","resolution":{"observed_at":"2026-08-07T14:25:19.525244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T14:25:19.604099Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.604099Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:2770908b33d0ae41b7a33024ce68353967780458417e42650b7dba716602f98f","observation_id":"00ac99af-f005-4de7-b4c8-10b652dab6c2","resolution":{"observed_at":"2026-08-07T14:25:19.604099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:19.673561Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.673561Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:8cd9e1159aadfe9d1e27287b075c6127af50863b24f9efc85e4cea80aee5ee80","observation_id":"a73e737e-1a7e-436f-821b-970c7579f6ed","resolution":{"observed_at":"2026-08-07T14:25:19.673561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.923465Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":"7362c1e0-027b-4022-9011-0012f43d660a","year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.745460Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1f4da8462b12efa4bd2355de990283778c8de1160a8681c4ec49ae50591bfd0a","observation_id":"82471f86-8c9e-4aea-8eba-95d0d6fb6a6a","resolution":{"observed_at":"2026-08-07T14:25:23.929603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.906600Z","title":"Intelligent selection of language model training data","venue":null,"work_id":"0a7cecfc-7626-4660-8fd7-233abec77264","year":2010},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.818399Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:3231de24c7d4076ec8cee944316b99630bd1b2e216a898c27f0ff58445327188","observation_id":"2bfb858c-ab44-4093-b67f-c1f624d15e86","resolution":{"observed_at":"2026-08-07T14:25:23.911761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.02279","last_updated":"2017-09-07T14:30:50Z","snapshot_observed_at":"2026-08-14T20:35:18.584925Z","submitted_at":"2017-09-07T14:30:50Z","title":"Cynical Selection of Language Model Training Data","version":1},"cited_work":{"arxiv_id":"1709.02279","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.02279","snapshot_observed_at":"2026-08-07T14:25:23.136208Z","title":"Cynical Selection of Language Model Training Data","venue":"cs.CL","work_id":"9d634d69-bea4-429b-a0bc-0b1934f0e306","year":2017},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:19.882220Z"},"links":{"cited_paper":"/paper/1709.02279","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:3dc220865f22d6f4996a7c3d39902e14efb88e8606a11b6f343b14a7dc4b606f","observation_id":"c452aa61-e1e1-4d88-b0e2-234b48fdb01e","resolution":{"observed_at":"2026-08-07T14:25:23.141447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10951","last_updated":"2022-10-26T01:05:51Z","snapshot_observed_at":"2026-08-16T16:22:41.557626Z","submitted_at":"2022-10-20T01:45:02Z","title":"Automatic Document Selection for Efficient Encoder Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10951","snapshot_observed_at":"2026-08-07T14:25:20.012070Z","title":"Automatic document selection for efficient encoder pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.012070Z"},"links":{"cited_paper":"/paper/2210.10951","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:422054adb465112a93c7b40305b76a713904df1f47f0b820ef36effe30ce526b","observation_id":"5a7ade20-0521-4473-bff6-3c1bb2bab8a8","resolution":{"observed_at":"2026-08-07T14:25:20.012070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:20.084156Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.084156Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:e77feb5d150b73fb9ff97c980f363801564ae1dd2c37ab193344bcf13265366b","observation_id":"7690d485-e810-4b73-9afc-bf3a14ecad51","resolution":{"observed_at":"2026-08-07T14:25:20.084156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.877009Z","title":"Skill-it! a data-driven skills framework for understanding and training language models","venue":null,"work_id":"16013488-c0c0-4028-86a7-7d6672caeab4","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.166474Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:72925c03a5f12ca57f3e25cf379a1d86dc5477974970e4a55c536313e97d2644","observation_id":"a9e3bc3b-a137-4acd-8a29-5540a37335c8","resolution":{"observed_at":"2026-08-07T14:25:23.883126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.852294Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":"f39f983e-9c88-4022-a418-cd368b1750a6","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.269168Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:fd707ec476fabe4e5e9efd1adae0ecc80131b1f116a6e686cc4bb4dbeaa3d6ce","observation_id":"0f8af9a2-3458-4764-aeb1-601c3b23e6f8","resolution":{"observed_at":"2026-08-07T14:25:23.858137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13008","last_updated":"2024-12-19T02:54:42Z","snapshot_observed_at":"2026-08-20T11:03:18.552428Z","submitted_at":"2023-10-16T07:26:24Z","title":"DavIR: Data Selection via Implicit Reward for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13008","snapshot_observed_at":"2026-08-07T14:25:20.358301Z","title":"Lobass: Gauging learnability in supervised fine-tuning data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.358301Z"},"links":{"cited_paper":"/paper/2310.13008","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:c883bd6920831b275f4a764463804091d837400ef34709ec018aff15217722de","observation_id":"9d30b2e6-7b81-498c-8c6b-2ded60bc6076","resolution":{"observed_at":"2026-08-07T14:25:20.358301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.827112Z","title":"Dataset cartography: Mapping and diagnosing datasets with training dynamics","venue":null,"work_id":"07a22b3f-6afa-46e8-b315-f9148b4229ac","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.437538Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:cca6eb8bd9955b933b06bd08e45182057348545c9e19afdef47205a6881e682f","observation_id":"29860640-ff21-4f63-ab10-007a95bad28e","resolution":{"observed_at":"2026-08-07T14:25:23.834143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06692","last_updated":"2024-07-08T02:52:05Z","snapshot_observed_at":"2026-08-16T17:00:38.013467Z","submitted_at":"2024-01-12T16:56:54Z","title":"An Experimental Design Framework for Label-Efficient Supervised Finetuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06692","snapshot_observed_at":"2026-08-07T14:25:20.521520Z","title":"An experimental design framework for label-efficient supervised finetuning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.521520Z"},"links":{"cited_paper":"/paper/2401.06692","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:ed203df15e7e56bbf5eda8515d833a3dc5be3388ecb43af68d4fb75291a833b2","observation_id":"17ea860b-5e66-4673-a0b5-82171a40dc6a","resolution":{"observed_at":"2026-08-07T14:25:20.521520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.803357Z","title":"D4: improving LLM pretraining via document de-duplication and diversification","venue":null,"work_id":"266566b7-d449-4840-b3bb-f052baf09b3a","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.741486Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:204655e2f48b6c5cc38aa5e7a8bf8bb83751aa3ad480394dd009ed80cb3cd4a8","observation_id":"e924ecee-3e7c-4541-92d8-d6c7929fd640","resolution":{"observed_at":"2026-08-07T14:25:23.808786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.781534Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":"91050df8-43eb-4c08-ba8a-f76144fa342a","year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:20.901391Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1da3c8f38bf1c2f21bf954a0e13a7d31dcadbd5917c3d55d36832688c7fb7452","observation_id":"474777d3-2037-4e4a-b396-c0df17e86390","resolution":{"observed_at":"2026-08-07T14:25:23.788444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.760512Z","title":"Learning from less data: A unified data subset selection and active learning framework for computer vision","venue":null,"work_id":"ff3ad466-9e18-4d1a-9130-0bd61ec92c8b","year":2019},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.067871Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4bc9ec031bcd45b0fb1049866bc37d15804f706a1bfb65adfc4aaadee570ed11","observation_id":"d87a0e1b-bd04-4182-a1aa-25df599736f9","resolution":{"observed_at":"2026-08-07T14:25:23.766973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.724917Z","title":"Retrieve: Coreset selection for efficient and robust semi-supervised learning","venue":null,"work_id":"5634bca0-b57a-41d6-9cc0-8eb234b30452","year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.234618Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:51f5c02cea01272a3eb36493297d52d8d46100b79bcf1c3b1d0b4e5e8b1a4329","observation_id":"8c036948-b5b7-4b01-80f2-b7226ffdb001","resolution":{"observed_at":"2026-08-07T14:25:23.735817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.696960Z","title":"Submodularity in data subset selection and active learning","venue":null,"work_id":"b6807ca0-df59-4bf4-a564-227f0ca6655c","year":1954},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.361747Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:da32bfbd84c4252c430e73345ea3256a8b5aae269e9c95d094597d2b14f7c786","observation_id":"5533b5e1-4487-4a27-967c-91930106f009","resolution":{"observed_at":"2026-08-07T14:25:23.709866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-08-19T15:08:34.393456Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-07T14:25:21.398721Z","title":"Alpagasus: Training a better alpaca with fewer data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.398721Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:a40009e0c2ec1015a2db3794aa43a3f6aaa3025df364845ac9e864e3506572ea","observation_id":"99c9d33d-1de1-48fa-897f-013f850ee489","resolution":{"observed_at":"2026-08-07T14:25:21.398721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06290","last_updated":"2024-07-26T18:09:11Z","snapshot_observed_at":"2026-08-18T08:00:36.453042Z","submitted_at":"2023-07-12T16:37:31Z","title":"Instruction Mining: Instruction Data Selection for Tuning Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06290","snapshot_observed_at":"2026-08-07T14:25:21.464252Z","title":"Instruction mining: Instruction data selection for tuning large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.464252Z"},"links":{"cited_paper":"/paper/2307.06290","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1bc2567c94769ed87f9c244fbcb9a948572ba784bb336ff9e36938d5287bea99","observation_id":"4553c525-29a0-4827-8eaf-0364a95e7b86","resolution":{"observed_at":"2026-08-07T14:25:21.464252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00489","last_updated":"2018-06-01T10:17:23Z","snapshot_observed_at":"2026-08-16T13:51:24.988660Z","submitted_at":"2017-08-01T19:50:53Z","title":"Active Learning for Convolutional Neural Networks: A Core-Set Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.00489","snapshot_observed_at":"2026-08-07T14:25:21.747454Z","title":"Active learning for convolutional neural networks: A core-set approach","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.747454Z"},"links":{"cited_paper":"/paper/1708.00489","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:d081db4c79a084f5cb562362a52a0b2b0d6bde36e352fef74498093c3fc08a6d","observation_id":"9427bd11-8fc2-4a97-a465-12efbb58d1fd","resolution":{"observed_at":"2026-08-07T14:25:21.747454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:21.789613Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.789613Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:59b26c960e0009c3a997128bcb3aa628b7bf6d655aff4cfa959ee55c5677444c","observation_id":"065bb8c1-8daf-4f54-84ed-cbfac5366862","resolution":{"observed_at":"2026-08-07T14:25:21.789613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.660128Z","title":"A software package for sequential quadratic programming","venue":null,"work_id":"1cd960ba-0642-4397-af5b-9f3a035cfc14","year":1988},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.870108Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:ebd87c0b050f55678c19b62058ac2180a1e07c1100e6122fe93fbb19c744c99d","observation_id":"9df2c883-9405-4900-8f21-f08980d7e081","resolution":{"observed_at":"2026-08-07T14:25:23.666379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.638252Z","title":"Fundamental algorithms for scientific computing in python and scipy 1.0 contributors","venue":null,"work_id":"c35fda3d-2823-4504-bef9-1e3d58e67f53","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:21.961637Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:996f75795ae2d4b04f3da9ab82efd8ed9b2296ebd2dce6bd021c8e1bd9e7c8b1","observation_id":"c5fb7ade-f1d3-47db-8a18-55d965c6d369","resolution":{"observed_at":"2026-08-07T14:25:23.646276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:25:22.030590Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.030590Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:15a7a7a2321630cec27a31480597708d62a877e1a2b6740133230dc7f65baffa","observation_id":"ac74536e-43cd-47ae-a685-e1c856b6fd0b","resolution":{"observed_at":"2026-08-07T14:25:22.030590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:25:22.093676Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.093676Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6fc7c7a338b572b44309e0b7396ccc6ca8a25dc1522b91f942e2faeafbf16d37","observation_id":"0cb541b8-9d92-4626-a4e5-89ebb8074ab1","resolution":{"observed_at":"2026-08-07T14:25:22.093676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-08-21T02:25:44.454471Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-07T14:25:22.179177Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.179177Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6e13b03efe75c6247000c906320fb581a7baf953d9fcfcb8ac13c10f7a1419b8","observation_id":"6fe5a871-a5ab-4ff0-94f1-476304d1d5d2","resolution":{"observed_at":"2026-08-07T14:25:22.179177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.621127Z","title":"Clark, Eunsol Choi, Michael Collins, Dan Garrette, Tom Kwiatkowski, Vitaly Nikolaev, and Jennimaria Palomaki","venue":null,"work_id":"aecfb686-68d5-4d57-8742-359dd225c478","year":2020},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.229023Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:308753f96eb15dd75e0435cf59b1fd5f2c789b71eb0239bffca139242c604717","observation_id":"32472503-e5aa-4826-985e-446ce7b0347a","resolution":{"observed_at":"2026-08-07T14:25:23.626327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:25:22.234458Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.234458Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1871bd83c1d44781d71e91e90cf629b557b35f52240916f03b8245f9d981b2a7","observation_id":"afb0ea76-2f23-4533-8c7d-5f4df29d6fcc","resolution":{"observed_at":"2026-08-07T14:25:22.234458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.239197Z","title":"SQ u AD : 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.239197Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4a244c95316b81e4bb5b35c269c6b2dfdecb027eff40c331d21f6ba645d6c81d","observation_id":"a31d4afe-dcec-4ff7-a1db-d94e91c7d41f","resolution":{"observed_at":"2026-08-07T14:25:22.239197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.245094Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.245094Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4dcb592a3ac5aa54d49edc902dd8fc72ca0a17fab3e600d08da607610c74c9cd","observation_id":"9245a6b5-e785-4207-b157-b69a084dad85","resolution":{"observed_at":"2026-08-07T14:25:22.245094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:25:22.249844Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.249844Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:40982766c65205c4b77653eb43bcc34045ba97ef3c9ed657554e30b1ef77af23","observation_id":"ebb0f529-46d0-4e5c-93d0-4a61e2cd81dc","resolution":{"observed_at":"2026-08-07T14:25:22.249844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10419","last_updated":"2024-08-19T21:12:41Z","snapshot_observed_at":"2026-08-16T13:25:23.422998Z","submitted_at":"2024-08-19T21:12:41Z","title":"Second-Order Forward-Mode Automatic Differentiation for Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10419","snapshot_observed_at":"2026-08-07T14:25:22.255032Z","title":"Second-order forward-mode automatic differentiation for optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.255032Z"},"links":{"cited_paper":"/paper/2408.10419","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:4cbd8cecbcd0db689b07013c8291b719acc572ec992277d6d77ac736d01e3f00","observation_id":"02a068f5-cbb0-4130-847b-dd55170a42e4","resolution":{"observed_at":"2026-08-07T14:25:22.255032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.260229Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.260229Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:94762610cdedc826710f9d22358dce9d513328a5b8add1b8d0fe700534b47835","observation_id":"6677dad7-ed6b-4286-9978-3af6fbc2b58e","resolution":{"observed_at":"2026-08-07T14:25:22.260229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14186","last_updated":"2023-04-03T17:37:50Z","snapshot_observed_at":"2026-08-18T07:05:12.412330Z","submitted_at":"2023-03-24T17:56:22Z","title":"TRAK: Attributing Model Behavior at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14186","snapshot_observed_at":"2026-08-07T14:25:22.265773Z","title":"Trak: Attributing model behavior at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.265773Z"},"links":{"cited_paper":"/paper/2303.14186","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:c9a88431b30d53f24521c5d7f88a552085b083fe1cdb9276f3da992450dae6e2","observation_id":"8e7dcbd0-9d4b-4b92-a234-6347c225cabd","resolution":{"observed_at":"2026-08-07T14:25:22.265773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01412","last_updated":"2021-04-29T16:44:25Z","snapshot_observed_at":"2026-08-20T01:10:01.850538Z","submitted_at":"2020-10-03T19:02:10Z","title":"Sharpness-Aware Minimization for Efficiently Improving Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01412","snapshot_observed_at":"2026-08-07T14:25:22.270445Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.270445Z"},"links":{"cited_paper":"/paper/2010.01412","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:f41a7c4dd23b0c4450e9d430268e81a2b62baba2b4f00c1b6cc7e9cabe6c3d4e","observation_id":"36afd5ad-b3d3-4fa0-8887-ea30f67f55c6","resolution":{"observed_at":"2026-08-07T14:25:22.270445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14200","last_updated":"2023-05-04T13:55:21Z","snapshot_observed_at":"2026-08-16T16:42:39.570053Z","submitted_at":"2022-07-28T16:13:28Z","title":"CrAM: A Compression-Aware Minimizer","version":4},"cited_work":{"arxiv_id":"2207.14200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.14200","snapshot_observed_at":"2026-08-07T14:25:22.745234Z","title":"CrAM: A Compression-Aware Minimizer","venue":"cs.LG","work_id":"be0b735e-dee4-4c0c-8039-6984160eca07","year":2022},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.275388Z"},"links":{"cited_paper":"/paper/2207.14200","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:57de31e8213457c23acbe0ebf18ce4f3544ed87d044d287db4ea30ab463c7a14","observation_id":"6e3305e8-fbf8-45f9-bbb6-941bef4d9fb2","resolution":{"observed_at":"2026-08-07T14:25:22.759076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.280856Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.280856Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:e360b77732c7af350a2e50eeea68fdf9204ced4d272d92791ae3639b0f9d9da1","observation_id":"47a69f1c-e9f3-4c64-bc1b-069c5604184e","resolution":{"observed_at":"2026-08-07T14:25:22.280856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.563964Z","title":"o pf, Yannic Kilcher, Dimitri Von R \\","venue":null,"work_id":"356a3263-8897-444e-94c5-8670368043df","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.286354Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:df62a150e485e56e838416ed59250fceb5f965ad44d34f312303c79e313e7dc7","observation_id":"47599f09-4443-44ff-b2e8-12eb9cd12737","resolution":{"observed_at":"2026-08-07T14:25:23.570719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.291632Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.291632Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:92061eb8d6602bf12c815b26784b22675dc7da0e71a0e6306cf41b568eeec5f1","observation_id":"e7186ae3-75ed-441f-8451-c12f5d1b4c9e","resolution":{"observed_at":"2026-08-07T14:25:22.291632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T14:25:22.297208Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.297208Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:ebfe7b69593a33d8c62a87dbdfbafb62f7f6938a1df608dbb92d85ef7f48e795","observation_id":"f75019a2-5318-439a-88c0-baa0a93723a8","resolution":{"observed_at":"2026-08-07T14:25:22.297208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.531741Z","title":"Code alpaca: An instruction-following llama model for code generation, 2023","venue":null,"work_id":"0fc1cabc-0001-40e5-bf40-5b0e372d856e","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.302484Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6def0ea2e8f45b373638efb21e4f5f82c6f08aacc13b2905c31e6b673262b59b","observation_id":"c8474305-6044-4d0e-9fb3-7910ac924ebb","resolution":{"observed_at":"2026-08-07T14:25:23.536533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.512047Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"c76f2f5f-ec31-49e9-85c6-ab6c201f2adb","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.309116Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:dc2ce822279f97a2c67ed1e0bf2f63a763cac8b704ad3ed96ee3acc6de5d22a2","observation_id":"d7bd0df5-54eb-484d-98e4-91e61d49214c","resolution":{"observed_at":"2026-08-07T14:25:23.518864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T14:25:22.315333Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.315333Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:2341dd5f664646dd881ffd1178ce6a3ad70b85c427461d5777ab194c2a130b4e","observation_id":"7068f832-bd6c-4fc5-86ef-328f9326f2f6","resolution":{"observed_at":"2026-08-07T14:25:22.315333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.488045Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces, 2023","venue":null,"work_id":"904f304e-5867-4737-9c4e-feee94bc207a","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.321452Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:dd14d97008ba63f4547b22890e0bb22f04fd2bfc95e3234cd10b849aceb4bac2","observation_id":"04a7edd7-6903-46dc-a012-cb0049da96f7","resolution":{"observed_at":"2026-08-07T14:25:23.498394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:22.327276Z","title":"Sciriff: A resource to enhance language model instruction-following over scientific literature","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.327276Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:a29be1a80467d0c82a10ae03fbd2f2b56ae16b765320fb86bc991b309ba9d8c9","observation_id":"01ff910e-d46c-4c31-9199-9d7d391b3146","resolution":{"observed_at":"2026-08-07T14:25:22.327276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T14:25:22.332639Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.332639Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:625b61ddab0abb4f921d961f0626f78b519b1e7e4b551e9c4b7f3c742209a272","observation_id":"de3062b4-e1da-4ee2-b833-0b457111a35e","resolution":{"observed_at":"2026-08-07T14:25:22.332639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-08-19T08:30:32.631359Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-07T14:25:22.337440Z","title":"Nv-embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.337440Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:3946fe6014eaf53c0a9f6402b3c8bae22f3df72a0de25dee270920a44a31aff0","observation_id":"e984cdef-35ff-4ca2-abb9-a64fe1702d18","resolution":{"observed_at":"2026-08-07T14:25:22.337440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07899","last_updated":"2021-12-15T05:33:27Z","snapshot_observed_at":"2026-08-16T17:34:32.967211Z","submitted_at":"2021-12-15T05:33:27Z","title":"Large Dual Encoders Are Generalizable Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07899","snapshot_observed_at":"2026-08-07T14:25:22.342650Z","title":"Large dual encoders are generalizable retrievers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.342650Z"},"links":{"cited_paper":"/paper/2112.07899","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:c28498b2c54c9569af7761fb3085bbe3905ffc40a6fa04a053828dcf168b9e84","observation_id":"261a37da-89c6-4cf4-83e0-86e9bdbd9157","resolution":{"observed_at":"2026-08-07T14:25:22.342650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-20T02:45:07.091553Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T14:25:22.348275Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.348275Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:3d2546785d9986fb2c213883a4a15f1f5b8d2a7c85cd2f13f87763de7f2c81b0","observation_id":"4d899f91-98c7-411e-a87d-069ad122b8f8","resolution":{"observed_at":"2026-08-07T14:25:22.348275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08832","last_updated":"2024-12-12T00:12:43Z","snapshot_observed_at":"2026-08-20T11:48:15.812596Z","submitted_at":"2024-12-12T00:12:43Z","title":"HadaCore: Tensor Core Accelerated Hadamard Transform Kernel","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08832","snapshot_observed_at":"2026-08-07T14:25:22.354721Z","title":"Hadacore: Tensor core accelerated hadamard transform kernel","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.354721Z"},"links":{"cited_paper":"/paper/2412.08832","citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:1d0da0d87aa7d98c28c37759289009aa2c2ed5bb15650d2e0f98ce789c268bba","observation_id":"f5039b9f-99d5-4e32-955f-13a37e0dc572","resolution":{"observed_at":"2026-08-07T14:25:22.354721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:23.465871Z","title":"Fast hadamard transform in cuda, with a pytorch interface, 2023","venue":null,"work_id":"fab65e96-c94f-48a2-9371-f907e42212f6","year":2023},"citing_paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:25:22.360806Z"},"links":{"citing_paper":"/paper/2505.19051"},"observation_digest":"sha256:6492f54ea7a99c47beb6d73ad3efaf37f55c33d901f16e287db6de29c70be92e","observation_id":"206e9a1f-4905-400d-a309-729e1907d5fb","resolution":{"observed_at":"2026-08-07T14:25:23.471206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19051","last_updated":"2025-05-25T09:08:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T01:26:59.525314Z","submitted_at":"2025-05-25T09:08:00Z","title":"Efficient Data Selection at Scale via Influence Distillation"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 1 inbound Pith citation observation for arXiv:2505.19051."}