{"as_of":"2026-08-09T20:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d73f92f4ce589561577c88b7f5d6363eb301c8f2601486c72dac1f87417e25b9","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:20:38.459757Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T00:56:04.958757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:58:25.718587Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"cited_work":{"arxiv_id":"2502.06244","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06244","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pike: Adaptive data mixing for multitask learning under low gradient conflicts","venue":null,"work_id":"6f246f80-322d-4655-9882-0c3c6e6e10d6","year":2025},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-08T06:45:13.140900Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2502.06244","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:f3d82ad5f896ef12afadfc72f2fea2e780e375d1c3b07609be31769e6e3f6e67","observation_id":"b09ad5ab-9b34-4b15-86d9-c498ab759d4f","resolution":{"observed_at":"2026-05-15T00:58:25.720393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06244/citation-record","integrity":"/paper/2502.06244/integrity","json":"/paper/2502.06244/citation-record.json","paper":"/paper/2502.06244"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-08T16:20:37.957601Z","title":"Abbas, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:37.957601Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4f88b75940138f58429b538e1fcdd035c157dbdecc30bdc748389069bb38024c","observation_id":"7eea74f6-9ee1-4216-9e36-571f6d6a40cb","resolution":{"observed_at":"2026-08-08T16:20:37.957601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T16:20:38.007383Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.007383Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:e3d16e1c70182d1a5c6e4ba80cd3469b72903ac62345c883f5aca95eaa73c213","observation_id":"bb5bc95b-0130-44d0-921e-ae70424bf682","resolution":{"observed_at":"2026-08-08T16:20:38.007383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15638","last_updated":"2024-07-02T02:09:32Z","snapshot_observed_at":"2026-07-06T17:34:49.001670Z","submitted_at":"2024-02-23T22:46:14Z","title":"Fair Resource Allocation in Multi-Task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15638","snapshot_observed_at":"2026-08-08T16:20:38.048244Z","title":"Ban and K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.048244Z"},"links":{"cited_paper":"/paper/2402.15638","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:45b7d7b4b8a1f27aea5d2f429b47ffb47f797ff06433e3c6412e698159ad1e7b","observation_id":"d16e5144-f9a8-4058-bfa5-f7d3dd021705","resolution":{"observed_at":"2026-08-08T16:20:38.048244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.642584Z","title":"Bengio, J","venue":null,"work_id":"24d29e81-8bc6-4a6f-a80e-b3e70146830a","year":2009},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.084266Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:9d4daa4d39753c71d987e06ce95ca94f0826b105cad3934a71bac419dcf2d031","observation_id":"0ab05056-708a-4eb4-b699-1bfbf031ea6a","resolution":{"observed_at":"2026-08-08T16:20:39.647558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.627019Z","title":null,"venue":null,"work_id":"6670f25a-ac79-484a-a55b-ee4f4953dda1","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.125257Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:cdb5378a349b1b0e906cec2f9df5ba36ddb790284eeaba16513fecde5ed34995","observation_id":"fed561dd-2124-4d5c-af46-cfe9dd3142c6","resolution":{"observed_at":"2026-08-08T16:20:39.631923Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.611211Z","title":"Bradbury, R","venue":null,"work_id":"6e36ff1f-c812-458b-a1ea-c4572cf6b6dc","year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.141490Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:bca227a15acc8e0a1e928b360684e338b53541c3a2c096a712697e20b40cd795","observation_id":"2e23761e-4bfd-4014-94fd-3a07a21c1811","resolution":{"observed_at":"2026-08-08T16:20:39.616164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.146418Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.146418Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:137e9b9183429fe1c5d027b4f816c21993a2ece92d0adb2bf349dcbc1b010592","observation_id":"aa8495b0-9022-44dc-becb-07962b10f208","resolution":{"observed_at":"2026-08-08T16:20:38.146418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.586065Z","title":null,"venue":null,"work_id":"b6e68ef7-a311-4708-ad60-b04036d049c7","year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.150633Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:7d4eb8cb0d437abdc9307d0355be64146188f0e7262e709273998259ce146335","observation_id":"4022e036-0f92-4b20-8b65-d5ef5535eb82","resolution":{"observed_at":"2026-08-08T16:20:39.591008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-08T16:20:38.154722Z","title":"Chowdhery, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.154722Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:f07e7879d3f782c8067c165048f0ea4a2a0235f273560f9dfadd38397392575b","observation_id":"e24d4ab6-2d26-45b4-8e5a-8ea07cd90dcc","resolution":{"observed_at":"2026-08-08T16:20:38.154722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.159387Z","title":"Chowdhery, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.159387Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:28e478dfce14c5efb992ba6eeb4d79b451e2847a1aa1d8b8078125f824ab814b","observation_id":"d509d39f-d615-4941-ac6b-5fcd5d29086f","resolution":{"observed_at":"2026-08-08T16:20:38.159387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T16:20:38.163261Z","title":"Clark, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.163261Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:389dff64f903b613f0b89f9f90a9fe39501a9fe77421f6340130ba49a2319543","observation_id":"80aa0092-58bc-4014-88ef-842146fc39e6","resolution":{"observed_at":"2026-08-08T16:20:38.163261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.560680Z","title":"Dac Lai, C","venue":null,"work_id":"f0f76d22-c70b-48b0-aeba-1804e16729f9","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.167134Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:73ca28abe76cd1c0fac0c1d48c59cb3a193d07039a8ca52162e4579f89840b43","observation_id":"99d68fc0-18d1-4ceb-acfb-3d044c95a3e5","resolution":{"observed_at":"2026-08-08T16:20:39.565564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.545487Z","title":null,"venue":null,"work_id":"1cd55ebc-4528-4b15-94e3-07a85d40ca65","year":2016},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.171109Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:d98294e5b1893e961b820583582dfd97fb6af465f4e12eebef7e218e2564601a","observation_id":"96c48b7a-c554-44f2-a567-4220d5598043","resolution":{"observed_at":"2026-08-08T16:20:39.550380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05442","last_updated":"2023-02-10T18:58:21Z","snapshot_observed_at":"2026-08-04T12:07:24.626442Z","submitted_at":"2023-02-10T18:58:21Z","title":"Scaling Vision Transformers to 22 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05442","snapshot_observed_at":"2026-08-08T16:20:38.174869Z","title":"Dehghani, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.174869Z"},"links":{"cited_paper":"/paper/2302.05442","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:5d46ff5060c1ff708e5155e4c8734b39ba45d0d5e3911b218ca5d2c82bb512d1","observation_id":"9573a299-a857-4fa5-b700-90716e570d7b","resolution":{"observed_at":"2026-08-08T16:20:38.174869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.529674Z","title":"Désidéri","venue":null,"work_id":"d1631e1e-ba61-49e4-adec-58786d481bcb","year":2012},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.179124Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:9a99a2e92cb6a19e4b3f3c68b091131dd52f2340eb8fb8bb526a3cf04d1280ea","observation_id":"222aa175-a7e4-4552-b185-e831da369416","resolution":{"observed_at":"2026-08-08T16:20:39.535036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T16:20:38.183058Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.183058Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:07c1ba528d248a0da300905c4ba56aa83b9f13d9666035cfff372369235a8cd7","observation_id":"6438c6fd-f81f-4cc1-8d9f-eb804d00af1e","resolution":{"observed_at":"2026-08-08T16:20:38.183058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.514738Z","title":null,"venue":null,"work_id":"1dcfef7a-4b47-48dc-bb51-0fa24c42d962","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.186992Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4b339d3b3e59e57bad56762b5d14f7477480ecbfbd84f7fe51bb77f37bb3ce3b","observation_id":"1d59d02a-9f09-4bd5-93ca-04f7984c889f","resolution":{"observed_at":"2026-08-08T16:20:39.519550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T16:20:38.191917Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.191917Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:9838afcc3449c79fa75c35539efc5edead0c651867ef450a2f8022f4e6de4cbc","observation_id":"51faab7c-590c-49ee-bbde-47358fd8bc07","resolution":{"observed_at":"2026-08-08T16:20:38.191917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.498128Z","title":"Gaffney, D","venue":null,"work_id":"1654f786-60e3-491f-8437-beb909d6eb8c","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.196888Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:965b3db4618942364d9b658602de3ac37610232124a205caea865ed537594ac2","observation_id":"3d3b51c1-4a66-43af-8dc0-93f942f09b8d","resolution":{"observed_at":"2026-08-08T16:20:39.503601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-08T16:20:38.201229Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.201229Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a15dadc51d94a61cb2260186cd0b707ae8b3daaf6aa7d678a9f9a31cabb5a26f","observation_id":"ae15711a-4fc0-4c9e-b3f8-47b28790e8a6","resolution":{"observed_at":"2026-08-08T16:20:38.201229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01956","last_updated":"2025-06-27T17:15:09Z","snapshot_observed_at":"2026-08-04T06:32:48.291603Z","submitted_at":"2025-01-03T18:59:23Z","title":"Metadata Conditioning Accelerates Language Model Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01956","snapshot_observed_at":"2026-08-08T16:20:38.205938Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.205938Z"},"links":{"cited_paper":"/paper/2501.01956","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:540212d2c4073a9b149a0ecf8b8078d0cfe3a224dbe4fe57ccf509c52f5d5f3e","observation_id":"4f39b70b-f8fe-45e9-9077-f493172e22b9","resolution":{"observed_at":"2026-08-08T16:20:38.205938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-07T08:10:41.068262Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-08T16:20:38.210654Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.210654Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:5540f94b997f5bde66ff35b4e5252e7feb6670b93545b8dfd77c0518be9430eb","observation_id":"e1e18744-1e5a-4135-a13b-a28118e13e12","resolution":{"observed_at":"2026-08-08T16:20:38.210654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.481990Z","title":"Grain - feeding jax models, 2023","venue":null,"work_id":"2e8ecb21-3f27-49f0-9c87-39176ccc6637","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.215359Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:6010082cc356fba654dbad80edbea1078eb83b2382088f330f953b7bb4ecb2df","observation_id":"aaa4398d-d4b3-4e59-9229-df950679d7bc","resolution":{"observed_at":"2026-08-08T16:20:39.486669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-06T16:31:19.141189Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-08-08T16:20:38.219629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.219629Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:8eb5c1dc0cd9a1205e7f85d3bef03bce44b1a4ff6e8d8b583a7af605abae4830","observation_id":"ec5e14aa-2d17-4068-8c94-99f3c1b3ecea","resolution":{"observed_at":"2026-08-08T16:20:38.219629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08114","last_updated":"2023-03-14T17:47:25Z","snapshot_observed_at":"2026-07-06T15:03:16.833701Z","submitted_at":"2023-03-14T17:47:25Z","title":"Simfluence: Modeling the Influence of Individual Training Examples by Simulating Training Runs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08114","snapshot_observed_at":"2026-08-08T16:20:38.223631Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.223631Z"},"links":{"cited_paper":"/paper/2303.08114","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:edeef2f0e4b0dcf69406bf15fd7734c40a38675766fe1bad409dffc34c7e6884","observation_id":"49da94a5-ba5d-4592-9fc8-99793e945086","resolution":{"observed_at":"2026-08-08T16:20:38.223631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.466566Z","title":null,"venue":null,"work_id":"ffd73bb2-5feb-4ea8-b65f-0d108739cac5","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.228040Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:40d90fb5d786af9e7044cf36121054f7b2e67a8c1bacf68e3e7d471c66e08b65","observation_id":"9704e15c-f232-4f7a-9ab6-02d7f1c73330","resolution":{"observed_at":"2026-08-08T16:20:39.471360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.450722Z","title":"Hoffmann, S","venue":null,"work_id":"715d19eb-d40d-43fd-830f-0ef6859661f7","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.231910Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:42179d733367857bae1f00238ba53a0c1cdd0a317694c2990c5d0bb4bc5fe4ee","observation_id":"e3362410-cd3a-4c67-9954-9a3cba00c1cc","resolution":{"observed_at":"2026-08-08T16:20:39.456007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-04T18:20:45.624958Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-08T16:20:38.235917Z","title":"Jiang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.235917Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:2784f7e9e3c87381f75f913782d27269c5945ae1c4da45e165d992f19bc760cc","observation_id":"c682751e-f173-4956-b12a-2c77e6c2917b","resolution":{"observed_at":"2026-08-08T16:20:38.235917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.435312Z","title":null,"venue":null,"work_id":"ce64d254-8784-465c-bea1-363fb8ae9d03","year":2017},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.240263Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:7bc7f019e87b0e9a71569677f8c1f31db87d4796d499ce973a0eca4252dcf72c","observation_id":"f6f930fb-f5ef-4ab3-a575-c6000b0a0f97","resolution":{"observed_at":"2026-08-08T16:20:39.440017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.420477Z","title":"Laurençon, L","venue":null,"work_id":"9ed14e1f-9d9d-4de8-b8cc-03ea292e749c","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.244092Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:2b4a7e6ccbcb14ea778b4e873443585daaa8a88830fac15f6bcc74fd216be465","observation_id":"5e6ab6f4-8e25-47d9-8bf6-b33023df33df","resolution":{"observed_at":"2026-08-08T16:20:39.424986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-08T16:20:38.248064Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.248064Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:5e6e899527ddbe56ffbd0994fcfc6f253ccea88e557fd21a3644046c67acefb4","observation_id":"99ab4cc0-eb81-487a-b8c9-a410b53ec1d9","resolution":{"observed_at":"2026-08-08T16:20:38.248064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08838","last_updated":"2018-04-24T04:29:10Z","snapshot_observed_at":"2026-08-06T23:47:57.134059Z","submitted_at":"2018-04-24T04:29:10Z","title":"Measuring the Intrinsic Dimension of Objective Landscapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08838","snapshot_observed_at":"2026-08-08T16:20:38.252309Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.252309Z"},"links":{"cited_paper":"/paper/1804.08838","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:fedf022390161a19bc3881ab218ca81ed21e6006a5162e521ae3900a1a5ffe68","observation_id":"0df1ed79-cb88-45ba-b876-2abb3c65208e","resolution":{"observed_at":"2026-08-08T16:20:38.252309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01162","last_updated":"2021-03-17T16:34:26Z","snapshot_observed_at":"2026-08-07T10:37:30.221346Z","submitted_at":"2020-07-02T14:49:48Z","title":"Tilted Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01162","snapshot_observed_at":"2026-08-08T16:20:38.256693Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.256693Z"},"links":{"cited_paper":"/paper/2007.01162","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:282f0679361febd81ea32a7ff602da943f3d168314b2dec7451da8025adcb38a","observation_id":"c7165800-d266-43e5-a708-d1d9beb882d8","resolution":{"observed_at":"2026-08-08T16:20:38.256693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-08T16:20:38.261204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.261204Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:3cc08ca8bb7e5511098a9cf7a895f58cc6a47d5b075d8dbfc3f26a3538b2d790","observation_id":"0ebbc5bc-b4bd-4e9f-b7c8-538b129b2a3b","resolution":{"observed_at":"2026-08-08T16:20:38.261204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.265770Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.265770Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:150bd31df32ed6ad0c939d918e6f6ff333cf1a04c1aaa39420ee5682800fbbb4","observation_id":"75570df8-02cd-49dc-99e2-82ef62db82c9","resolution":{"observed_at":"2026-08-08T16:20:38.265770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.394650Z","title":null,"venue":null,"work_id":"fbd64d81-645b-44f1-a953-b106f4c234fa","year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.269893Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:73f4cee64a7682ad9f12654e569b4a060126df19ea3321add75f6314ed1119d8","observation_id":"987a94fa-0333-4995-acd7-d7687431f4c6","resolution":{"observed_at":"2026-08-08T16:20:39.399591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.379208Z","title":null,"venue":null,"work_id":"2758fd3f-4bde-4d16-a70f-037fe6b86aac","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.274218Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:0bf2a1290c3947ed75b67eebd9f0d80a9ace8d71ff6d8a16e5580675948956e6","observation_id":"c7e739be-ec96-4b2c-b030-bbec1ed76556","resolution":{"observed_at":"2026-08-08T16:20:39.384081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-09T06:27:14.768185Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-08T16:20:38.278606Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.278606Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:62def6b07e2b618a12fe7e67ce8ad3963e9da7b861d77195884b09335d1d903a","observation_id":"c446b3ae-c66f-4750-a6fa-c89a146a83e0","resolution":{"observed_at":"2026-08-08T16:20:38.278606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.362860Z","title":null,"venue":null,"work_id":"7927553c-4cd6-420b-a976-d25593469907","year":2015},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.283009Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:fb1c1c7965c2e9688b336558e82a8776c49e5bcf30b42a8854e9e1ae95dfb6f0","observation_id":"cf503f5f-4eb8-4b62-b3c9-9199d29ad02d","resolution":{"observed_at":"2026-08-08T16:20:39.368238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11504","last_updated":"2019-05-30T00:01:20Z","snapshot_observed_at":"2026-07-06T07:30:20.997518Z","submitted_at":"2019-01-31T18:07:25Z","title":"Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11504","snapshot_observed_at":"2026-08-08T16:20:38.287083Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.287083Z"},"links":{"cited_paper":"/paper/1901.11504","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:9d450eaa17346f3bde4519ddefd64cbd93bc18909aafca96b1e00b26c5484d85","observation_id":"0f5ff7bc-e362-4451-ad1d-a7f9cf62e3c7","resolution":{"observed_at":"2026-08-08T16:20:38.287083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.346683Z","title":"Loshchilov and F","venue":null,"work_id":"8a211d89-1f07-46d7-80b8-9ebe26582736","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.291352Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:8e87c636ed7ebb7d2354b9236fa55996a8eb068a1f248eb829db008a6d25f769","observation_id":"54ccfab3-0751-4d21-a7a3-10c1c037aedd","resolution":{"observed_at":"2026-08-08T16:20:39.351350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06114","last_updated":"2016-03-01T10:55:58Z","snapshot_observed_at":"2026-08-01T19:23:26.365417Z","submitted_at":"2015-11-19T10:24:14Z","title":"Multi-task Sequence to Sequence Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06114","snapshot_observed_at":"2026-08-08T16:20:38.295637Z","title":"Luong, Q","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.295637Z"},"links":{"cited_paper":"/paper/1511.06114","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:af6bf631c334a0ea06cd827aaf93fbf51d4fdc910fa5f9eaa62e36a9381aa352","observation_id":"cf99c504-1c9a-432f-8198-869faa32fc2a","resolution":{"observed_at":"2026-08-08T16:20:38.295637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.330717Z","title":"Misra, A","venue":null,"work_id":"c39f1f77-09df-4460-bc3d-c110a79e1d1a","year":2016},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.300877Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:9f7a8630d8562cb80cdb5497859e7d5a23006b62c86dcb15992285aa2ecb0128","observation_id":"1afe68c2-849a-4d38-a71f-28fa749b8153","resolution":{"observed_at":"2026-08-08T16:20:39.335747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.314590Z","title":"Mo and J","venue":null,"work_id":"783077f8-d15d-4819-b209-9c7c4cdbce4b","year":2000},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.305596Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:f68550c6df14f74b96b3abca72c86acb1b12caf69c45981cb9277c68ee65726c","observation_id":"8e41af2d-9a11-4b02-8e50-03665eada8c5","resolution":{"observed_at":"2026-08-08T16:20:39.319555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01017","last_updated":"2022-07-08T12:00:51Z","snapshot_observed_at":"2026-08-09T06:27:19.794815Z","submitted_at":"2022-02-02T13:21:53Z","title":"Multi-Task Learning as a Bargaining Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01017","snapshot_observed_at":"2026-08-08T16:20:38.309736Z","title":"Navon, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.309736Z"},"links":{"cited_paper":"/paper/2202.01017","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:ca5fb3cea977ada74f6fe6d3a6d7a1d6ab44f12c56d968fbccee10b723132201","observation_id":"9a1e5879-c521-45b6-917c-5dbe6f8d4c9c","resolution":{"observed_at":"2026-08-08T16:20:38.309736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.299209Z","title":"Penedo, Q","venue":null,"work_id":"09ce3947-6db0-45c5-8251-47104faa095a","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.314537Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:86a2f9b85caf8271c6099624cda1dcef5fb385eb8cf7da045a9e83cced832598","observation_id":"0a4ba645-45b0-4ec2-b908-470ef9279f98","resolution":{"observed_at":"2026-08-08T16:20:39.303950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.283446Z","title":"Radford, J","venue":null,"work_id":"a3111ac8-2661-4af5-809e-4289e1c1d7ba","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.318950Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:11091efe28b07f85bf3978e5b6a657b6af00e47d59b01a843d2cb1e42ccdfabf","observation_id":"e1d548c3-28ac-4e0a-95d0-46a1553ef4b7","resolution":{"observed_at":"2026-08-08T16:20:39.288553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-08T16:20:38.323545Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.323545Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:937ace57db63dce5fd481debe591ee9437a44814367af9188cf68a01ce365b0a","observation_id":"2ef21911-e49e-48be-ab7c-68bfb4258a3c","resolution":{"observed_at":"2026-08-08T16:20:38.323545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.328289Z","title":"Raffel, N","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.328289Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:0184aaca368fb749c902206003fa8c3cad0259ca14c498d102d4da72079f7748","observation_id":"79b76872-62a3-40d7-a582-b15917294a48","resolution":{"observed_at":"2026-08-08T16:20:38.328289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.257077Z","title":null,"venue":null,"work_id":"dcdd2241-e4fb-4afa-a96f-ea387a3d5720","year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.333260Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:3860b2f4ef832d2dcd034a686bf3a779d3231821cd21980545175235fab4dc64","observation_id":"d7f54b89-7261-465a-9cf9-503e944282ab","resolution":{"observed_at":"2026-08-08T16:20:39.261658Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.241334Z","title":null,"venue":null,"work_id":"72f7e703-37e9-44ff-90d0-592b0d7d9a94","year":2015},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.337868Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:2d8a5dd064a10f9b7de42739355d11432adb43904be395f4e4dbff1e01a57763","observation_id":"fdc47634-9848-43c4-abfd-35cbbe314686","resolution":{"observed_at":"2026-08-08T16:20:39.246529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.226387Z","title":"Ruder, J","venue":null,"work_id":"8c958cf3-017d-43ef-94b8-1b5e7dbebfab","year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.342477Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:e8ff3e3cfa0f009bc3737d72761409d5775fb8dcd6edb03448061f090a661093","observation_id":"d8736690-d5ea-4809-bf17-54a48c7eb8bd","resolution":{"observed_at":"2026-08-08T16:20:39.230987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-08T16:20:38.347017Z","title":"Sachdeva, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.347017Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:8abecf9282dae9ca830a9755497c3e08a74eb520ba9593a6705a008d2d2c611b","observation_id":"1d43c75f-11a3-48e7-8928-a35bf4795c4b","resolution":{"observed_at":"2026-08-08T16:20:38.347017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.211446Z","title":"Sener and V","venue":null,"work_id":"56259584-0be1-4d15-acf6-71120a1ab013","year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.351756Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:66cec07e1a69dde54ec7a695b9312a2c6081b71dc0b4320e8ac89ead115e1fe2","observation_id":"403571f5-d54f-47b8-9a38-be03c2d9339b","resolution":{"observed_at":"2026-08-08T16:20:39.216383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-08T04:07:59.311599Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-08T16:20:38.356201Z","title":"Soldaini, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.356201Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:ff7aaf64645d77bc2e934620deaba0a7fd6d38de746627b28a9abbaee2f01466","observation_id":"0c2be998-8b9a-4f80-a280-c8c336a5c1bf","resolution":{"observed_at":"2026-08-08T16:20:38.356201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-08T16:20:38.360914Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.360914Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:765a8d3a109f82b2fe359457ca077aa54a60dc0162fde158f6ff1a540af559ed","observation_id":"f9be65c8-ad75-433f-8db5-5058dfd3ef87","resolution":{"observed_at":"2026-08-08T16:20:38.360914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-08T16:20:38.365866Z","title":"Talmor, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.365866Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:f961a9b2e348bd46cddd531849e7b1af09bee0da40d7a8efb7055698b3551816","observation_id":"17d9457b-b5c7-4ec6-a3b4-61239f420115","resolution":{"observed_at":"2026-08-08T16:20:38.365866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10686","last_updated":"2022-01-30T16:42:46Z","snapshot_observed_at":"2026-07-06T11:50:13.578611Z","submitted_at":"2021-09-22T12:29:15Z","title":"Scale Efficiently: Insights from Pre-training and Fine-tuning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10686","snapshot_observed_at":"2026-08-08T16:20:38.370936Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.370936Z"},"links":{"cited_paper":"/paper/2109.10686","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:bc90a09429a944287e68c3debaf1b95e263c379d4d7c2bc7d6f14ae40266b607","observation_id":"f22ca0db-c68d-4623-9a52-b12d456b3865","resolution":{"observed_at":"2026-08-08T16:20:38.370936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-08T16:20:38.375675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.375675Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:223e7c1b527ddb35be888995957758e8ade37638c7aa7d08d7a3ac141a520a4e","observation_id":"88a8da9a-7b5c-41d3-9d59-266cfc7d4f69","resolution":{"observed_at":"2026-08-08T16:20:38.375675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T16:20:38.380223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.380223Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:97c5d0116911b9df6387bfbafe17698dca0cdff5550df8082c683d713079f3a3","observation_id":"447e7f22-6ef8-4866-8fa7-81b1eeffe5ff","resolution":{"observed_at":"2026-08-08T16:20:38.380223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.195977Z","title":"Vandenhende, S","venue":null,"work_id":"a67d8a59-adf9-45da-9a44-dad6672498cf","year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.385221Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:00ddf5f8275ecc7e790152ad581c4bb80bbe6aa7d5e67c934b336c97884ae40f","observation_id":"f1334642-6086-463b-9e70-0259f235dc81","resolution":{"observed_at":"2026-08-08T16:20:39.200772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15613","last_updated":"2024-06-28T09:22:38Z","snapshot_observed_at":"2026-07-06T18:19:25.869339Z","submitted_at":"2024-05-24T14:58:51Z","title":"Automatic Data Curation for Self-Supervised Learning: A Clustering-Based Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15613","snapshot_observed_at":"2026-08-08T16:20:38.389831Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.389831Z"},"links":{"cited_paper":"/paper/2405.15613","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:aa0dc6b2374415231ef8af935555825b44630b1bdccb079b3443845d808fdc4f","observation_id":"7fcbe20f-713a-4f59-aad5-012ad183fe53","resolution":{"observed_at":"2026-08-08T16:20:38.389831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:38.394565Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.394565Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a2e6f7eac9fe9b7615ea36f704ffbfd9b45ef965e2ea16b2fa7be7722dcbdb00","observation_id":"86bf22b8-0dc6-4043-a6f1-8ff7c8787b75","resolution":{"observed_at":"2026-08-08T16:20:38.394565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05874","last_updated":"2020-10-12T17:26:34Z","snapshot_observed_at":"2026-08-09T13:19:30.075014Z","submitted_at":"2020-10-12T17:26:34Z","title":"Gradient Vaccine: Investigating and Improving Multi-task Optimization in Massively Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05874","snapshot_observed_at":"2026-08-08T16:20:38.399019Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.399019Z"},"links":{"cited_paper":"/paper/2010.05874","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:65f330cd2186a855cfdf7dd095a132e4fdc4cbfbfa4d36b838394d7f88c6c79c","observation_id":"b60273fd-11f9-4a60-a61d-f52a6d896b45","resolution":{"observed_at":"2026-08-08T16:20:38.399019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-07-06T17:30:25.359458Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-08-08T16:20:38.403659Z","title":"Wettig, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.403659Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:c35cf8c172107c6ec8045e5542bf6e16bd7bf670dd34df437bba9b0a59a6a368","observation_id":"55dfd1c6-7e30-49b7-ace6-f1c89c901824","resolution":{"observed_at":"2026-08-08T16:20:38.403659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-08-09T17:02:30.910087Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-08T16:20:38.408373Z","title":"Wortsman, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.408373Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:090ff7d6cab841b2ebfff4bf58c496f57e1d619bafabb06bbe5b80724241a4f9","observation_id":"2010af6c-5a83-440d-8144-4115041fd377","resolution":{"observed_at":"2026-08-08T16:20:38.408373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-08T16:20:38.413011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.413011Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:4df4609d239285b3b2a338d3f57bba5385507344cd14a1f40e8b9cabacf4bef8","observation_id":"b18f82e8-ea7b-42dd-b668-4d9ab07d267d","resolution":{"observed_at":"2026-08-08T16:20:38.413011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.169122Z","title":null,"venue":null,"work_id":"ae03c9aa-0740-4943-93a5-4051a0c68b78","year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.417678Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:b11ef9a22db12e3ac0c90c0e8effdb8c0fca5ed66a016cdc685e49a2da749746","observation_id":"12476dd6-b919-42df-a259-77720843e885","resolution":{"observed_at":"2026-08-08T16:20:39.174015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.153729Z","title":null,"venue":null,"work_id":"089e3980-503a-467e-aafc-cf43aa51f028","year":2022},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.422068Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:e811d666c359344954f43615e0423fb899e2ae67790f2108c79e39fc6666e10e","observation_id":"d3bc8e8d-d6b4-4994-a9f0-578e3199c325","resolution":{"observed_at":"2026-08-08T16:20:39.158872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-09T05:32:57.900052Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-08T16:20:38.426348Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.426348Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:73244f20d296b470d44e9107514c48544375cca4a13e54c8ec57d382199d83b7","observation_id":"0bd3df9e-7d8b-44d7-a9ca-df8be45cc50c","resolution":{"observed_at":"2026-08-08T16:20:38.426348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13626","last_updated":"2022-03-08T02:18:51Z","snapshot_observed_at":"2026-08-08T00:04:26.808792Z","submitted_at":"2021-05-28T07:03:22Z","title":"ByT5: Towards a token-free future with pre-trained byte-to-byte models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13626","snapshot_observed_at":"2026-08-08T16:20:38.430971Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.430971Z"},"links":{"cited_paper":"/paper/2105.13626","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:3b83adfa868a4dfa08394482d1608e714a97e42b253afe476f75314a3495b174","observation_id":"7a1b2ca3-f15d-432c-b82b-4d3bc560187b","resolution":{"observed_at":"2026-08-08T16:20:38.430971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.137746Z","title":null,"venue":null,"work_id":"8a81e69c-cbb6-43ef-b243-84df4a9ec934","year":2023},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.435717Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:434d98c3e265d909eb6a4c90416cd55b00c3c0cdca6d8820e1c0139343c56638","observation_id":"bdeffc12-87f1-4fb0-a7dd-6b16b2c8bc86","resolution":{"observed_at":"2026-08-08T16:20:39.142824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-08T16:20:38.440209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.440209Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a64eb5d430af59305fdf1ff2666882cf98722caf5e2b763468b43280a0b4890c","observation_id":"6573b0bb-16db-45b0-b561-b91f1d432115","resolution":{"observed_at":"2026-08-08T16:20:38.440209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.121156Z","title":null,"venue":null,"work_id":"aca6bfc3-7486-40a8-95e7-9393e39ae7e0","year":2020},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.445128Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:a9b083f71e988885789d12c942497f5733b484ba9187e5dde4425fa63f10e775","observation_id":"03962849-f2b2-4453-bb7e-f8d3426bd3a9","resolution":{"observed_at":"2026-08-08T16:20:39.126374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-08T16:20:38.449710Z","title":"Zellers, A","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.449710Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:211180000c7c9672d9dd50808040022ce23d3806bf1d1f6a008ffcc05e1d6c8e","observation_id":"39479523-eb42-40a3-8967-a13e0f4595a5","resolution":{"observed_at":"2026-08-08T16:20:38.449710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-08T16:20:38.454661Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.454661Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:364544448b9b0d5dcc7b34547922b13663dce53d3a2b727906b872f43f9c33c9","observation_id":"faaeb223-ad35-4ee3-baf9-813f5dbef9fe","resolution":{"observed_at":"2026-08-08T16:20:38.454661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:20:39.101088Z","title":"ratio,” which defined as ⟨Lj (θ),Lk(θ)⟩ ∥Lj (θ)∥2+∥Lk(θ)∥2 , between task gradients during language model pre-training over time. “ data1- data2","venue":null,"work_id":"29d9e3e8-f655-4ed9-ad9b-798d541f5312","year":null},"citing_paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T16:20:38.459757Z"},"links":{"citing_paper":"/paper/2502.06244"},"observation_digest":"sha256:840d3641c55c25b88b419967defadf7f7762324e23f316394fc3e7d8d170255e","observation_id":"689bb806-2dd1-40a5-b6c1-2b897d0383f1","resolution":{"observed_at":"2026-08-08T16:20:39.109219Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06244","last_updated":"2025-06-04T02:16:01Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T15:20:25.734420Z","submitted_at":"2025-02-10T08:23:05Z","title":"PiKE: Adaptive Data Mixing for Large-Scale Multi-Task Learning Under Low Gradient Conflicts"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2502.06244."}