{"as_of":"2026-08-15T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd924c11443184d23aed843a2d6b8cfe3f9c83cbee85ae02800bbe0d8f051a6f","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:04:24.977197Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:17:27.176059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20380","snapshot_observed_at":"2026-08-03T04:17:27.176059Z","title":"Grape: Optimize data mixture for group robust multi-target adaptive pretraining.arXiv preprint arXiv:2505.20380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-08T23:12:50.234380Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.176059Z"},"links":{"cited_paper":"/paper/2505.20380","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:a197ed9c68fc0370c7d7d89fac7901e8aa83dd7f8a23c289437ce7414d420254","observation_id":"c1292400-923a-4c76-bc8e-077a045b9afa","resolution":{"observed_at":"2026-08-03T04:17:27.176059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20380/citation-record","integrity":"/paper/2505.20380/integrity","json":"/paper/2505.20380/citation-record.json","paper":"/paper/2505.20380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:22.381295Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.381295Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:35282fa3028e4d614fd98f2c8d5e943b82a57b0ccbbf7ea0e662fceb55908e7c","observation_id":"891c50f9-c251-4812-a846-2013608f0c80","resolution":{"observed_at":"2026-08-07T14:04:22.381295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:26.257489Z","title":"Redpajama: An open source recipe to reproduce llama training dataset, 2023","venue":null,"work_id":"4a2dc5b0-7ac5-4a35-b462-b8081d4daa99","year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.438328Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:bdfef744055a37dc72e0f2cdb8290a84529b064765881bbe5fa8b947aa14ade5","observation_id":"a3914e3c-bc38-4ed8-a2e0-a02e4569b9f7","resolution":{"observed_at":"2026-08-07T14:04:26.325372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-08-13T14:20:22.971379Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-07T14:04:22.550042Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.550042Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:ebec8a721c5f17af556d016ae00ea1bb61a3e8e838b30dc9ecc5996712ce620b","observation_id":"b4303d09-6850-428d-9ed4-32fa963c15ef","resolution":{"observed_at":"2026-08-07T14:04:22.550042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-08-12T23:31:04.473877Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T14:04:22.629012Z","title":"Regmix: Data mixture as regression for language model pre-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.629012Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:bb96c0959cdd59501b25ecc1c92a6e6920861fa499f62a498e03993e3390b637","observation_id":"5845024c-8104-4c50-90dd-1a03c46a31a9","resolution":{"observed_at":"2026-08-07T14:04:22.629012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-14T22:09:51.012352Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-07T14:04:22.784397Z","title":"Doge: Domain reweighting with generalization estimation, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.784397Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:09baf5040f24a27be6a008e8f8614cd3fe86a23be405968fc7ef112b66127588","observation_id":"59c3bb8f-c3bd-49c5-977d-081837ee815c","resolution":{"observed_at":"2026-08-07T14:04:22.784397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03735","last_updated":"2025-03-11T00:20:30Z","snapshot_observed_at":"2026-08-12T22:33:54.825147Z","submitted_at":"2024-09-30T20:49:54Z","title":"Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03735","snapshot_observed_at":"2026-08-07T14:04:22.901349Z","title":"Task-adaptive pretrained language models via clustered-importance sampling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.901349Z"},"links":{"cited_paper":"/paper/2410.03735","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:8625626f1a8674948ba06547113b9b9afd26833a4e9d5f7d28d2f8ccad29d693","observation_id":"4514bdcb-4843-496a-b304-2ba5fc63bd0c","resolution":{"observed_at":"2026-08-07T14:04:22.901349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02498","last_updated":"2024-10-03T14:00:44Z","snapshot_observed_at":"2026-08-12T22:31:38.874006Z","submitted_at":"2024-10-03T14:00:44Z","title":"Dynamic Gradient Alignment for Online Data Mixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02498","snapshot_observed_at":"2026-08-07T14:04:22.974581Z","title":"Dynamic gradient alignment for online data mixing, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:22.974581Z"},"links":{"cited_paper":"/paper/2410.02498","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:c1c653e209c6249e5d81b6627b8277743ac766942e4796c5ff418f615d79bc8a","observation_id":"9e77b75e-a9a1-4abf-8af6-eed623f1219b","resolution":{"observed_at":"2026-08-07T14:04:22.974581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-08-10T13:07:02.974893Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-07T14:04:23.075091Z","title":"Gradient surgery for multi-task learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.075091Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:d6c39b74a5fdbd2bdf12db378d68e6c645d906397c4ff7b85d6ed45f12ded595","observation_id":"ddf230ea-6079-4599-bf9e-7fea37ee7b7d","resolution":{"observed_at":"2026-08-07T14:04:23.075091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03792","last_updated":"2023-10-30T02:45:50Z","snapshot_observed_at":"2026-08-13T11:23:19.247071Z","submitted_at":"2023-06-06T15:39:54Z","title":"FAMO: Fast Adaptive Multitask Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03792","snapshot_observed_at":"2026-08-07T14:04:23.171525Z","title":"Famo: Fast adaptive multitask optimization, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.171525Z"},"links":{"cited_paper":"/paper/2306.03792","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:90b87aeb659011c08faeb3f825b2ccbd5a8935b9c8ac24c2a587be574817822b","observation_id":"fc54a80d-348a-4890-8693-3559ff35ebce","resolution":{"observed_at":"2026-08-07T14:04:23.171525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01793","last_updated":"2024-09-03T11:17:44Z","snapshot_observed_at":"2026-08-15T04:23:18.427569Z","submitted_at":"2024-09-03T11:17:44Z","title":"Task Weighting through Gradient Projection for Multitask Learning","version":1},"cited_work":{"arxiv_id":"2409.01793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01793","snapshot_observed_at":"2026-08-07T14:04:25.594547Z","title":"Task Weighting through Gradient Projection for Multitask Learning","venue":"cs.LG","work_id":"8160f680-8195-4b47-a13f-e9fa97d3bb2d","year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.239267Z"},"links":{"cited_paper":"/paper/2409.01793","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:dd09d61350eb0554289783d35d4d87dc2d25225a3e3083a68e1e1d2a78e28b87","observation_id":"92c0370f-7511-416a-a66f-6593e8b22641","resolution":{"observed_at":"2026-08-07T14:04:25.628062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08750","last_updated":"2020-07-18T01:20:20Z","snapshot_observed_at":"2026-08-14T18:11:52.942637Z","submitted_at":"2018-10-20T03:50:29Z","title":"Learning Models with Uniform Performance via Distributionally Robust Optimization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08750","snapshot_observed_at":"2026-08-07T14:04:23.320223Z","title":"Learning models with uniform performance via distributionally robust optimization, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.320223Z"},"links":{"cited_paper":"/paper/1810.08750","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:fd7ac2cfe5112f43c53b81dd7497d776201f98545a1e7cf02b292d36857fee59","observation_id":"890473d1-52e4-421e-9104-c33da6a6e0ee","resolution":{"observed_at":"2026-08-07T14:04:23.320223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-14T08:06:00.989531Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-07T14:04:23.384622Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.384622Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:b42e3a3682703b2033981be1cbaaef7e813d445a5a9957ad6d90b405f4ef9cb0","observation_id":"01494077-0de8-451a-9b61-b332c00f151f","resolution":{"observed_at":"2026-08-07T14:04:23.384622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10138","last_updated":"2021-11-12T15:52:00Z","snapshot_observed_at":"2026-08-09T06:27:59.636131Z","submitted_at":"2020-06-17T20:19:25Z","title":"An Online Method for A Class of Distributionally Robust Optimization with Non-Convex Objectives","version":5},"cited_work":{"arxiv_id":"2006.10138","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.10138","snapshot_observed_at":"2026-08-07T14:04:25.399472Z","title":"An Online Method for A Class of Distributionally Robust Optimization with Non-Convex Objectives","venue":"cs.LG","work_id":"f8e598b3-9a06-40b3-99f8-6946f407f183","year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.474114Z"},"links":{"cited_paper":"/paper/2006.10138","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:663558de9c81ac33d7f5f013266dfe0e2ee56cef0a667e6c3ec36d5d201c34f4","observation_id":"2161bc10-f925-448e-8759-e77f382bd826","resolution":{"observed_at":"2026-08-07T14:04:25.474251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:26.055342Z","title":"Stochastic gradient methods for distributionally robust optimization with f-divergences","venue":null,"work_id":"1042a112-fd08-4d4e-9b14-4a5387b872fe","year":2016},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.584016Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:b2f5a3c8067ab83b1353489dcbd563ab1f513684f599802588f4b755a1cac065","observation_id":"48ac4f27-bcf8-43ea-98d2-556ad10af6f0","resolution":{"observed_at":"2026-08-07T14:04:26.145954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T14:04:23.690591Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.690591Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:55e1b05be9386ef93b4fcf28e46817aa1af95cfae3d0f5c39b6d3aafd3be1e5e","observation_id":"6428e2da-6ee0-4c9d-a343-0a49a53c2441","resolution":{"observed_at":"2026-08-07T14:04:23.690591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13161","last_updated":"2025-11-30T07:03:40Z","snapshot_observed_at":"2026-08-15T12:44:51.354243Z","submitted_at":"2025-04-17T17:58:13Z","title":"Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13161","snapshot_observed_at":"2026-08-07T14:04:23.796108Z","title":"Climb: Clustering-based iterative data mixture bootstrapping for language model pre-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.796108Z"},"links":{"cited_paper":"/paper/2504.13161","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:870497c579e002f49a8e8b5f589aedc198855204302fd6a76b1636e63a2879ca","observation_id":"8d2d5629-0069-4604-8384-21c8d0164403","resolution":{"observed_at":"2026-08-07T14:04:23.796108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T14:04:23.913426Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:23.913426Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:c344d47d2e1df470dcbc856059abf56c6e3f3510233de3b98ae0b786d89075b3","observation_id":"b47ec271-8c07-4c8d-b297-fe2d808ee1c9","resolution":{"observed_at":"2026-08-07T14:04:23.913426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-14T20:46:34.382946Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-07T14:04:24.035893Z","title":"Liu, and Matt Gardner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.035893Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:97c0f67171c102bf35e1d816cffe2cc7774709c611fe42fe0c04a5535b7e43d9","observation_id":"f8c2bc0f-7a6c-4fa5-893d-9d91a140078c","resolution":{"observed_at":"2026-08-07T14:04:24.035893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11641","last_updated":"2019-11-26T15:31:46Z","snapshot_observed_at":"2026-08-08T00:48:01.603669Z","submitted_at":"2019-11-26T15:31:46Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11641","snapshot_observed_at":"2026-08-07T14:04:24.118899Z","title":"Piqa: Reasoning about physical commonsense in natural language, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.118899Z"},"links":{"cited_paper":"/paper/1911.11641","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:0e146cf9dc82f2c461db356e379929444dd2aa0af23998ffa7410780d4f7d938","observation_id":"948a9799-9802-45c3-8935-abbffd40b00a","resolution":{"observed_at":"2026-08-07T14:04:24.118899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-07T14:04:24.217182Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.217182Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:fa9d64d73556025b17f788c7c82f4ea73a3c979759b07a3b07154a356cae787b","observation_id":"5d2d7f5b-e799-49fe-bfe4-cc6e5db02d67","resolution":{"observed_at":"2026-08-07T14:04:24.217182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T14:04:24.262249Z","title":"Hellaswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.262249Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:1daf2f432d9dce7678c4e53a4f342780a318df82352598622c021d5d12bb0c7d","observation_id":"4f8b13c0-bbd2-4f9c-bf77-18f58daf0c7d","resolution":{"observed_at":"2026-08-07T14:04:24.262249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:25.928761Z","title":"W iki-40 B : Multilingual language model dataset","venue":null,"work_id":"64c6493b-8841-4f6d-91b6-b9cb0c070c1b","year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.331842Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:ed59a4a1b96c964e5a133af144845fb3db6ce0d364f1a759bdc4007ecaf12c70","observation_id":"3f4148fc-f73e-403c-b182-5b53eb5ad82f","resolution":{"observed_at":"2026-08-07T14:04:25.971942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14430","last_updated":"2023-07-26T18:01:49Z","snapshot_observed_at":"2026-08-13T10:47:20.944094Z","submitted_at":"2023-07-26T18:01:49Z","title":"Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14430","snapshot_observed_at":"2026-08-07T14:04:24.403499Z","title":"Chen, Nicholas Roberts, Kush Bhatia, Jue Wang, Ce Zhang, Frederic Sala, and Christopher Ré","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.403499Z"},"links":{"cited_paper":"/paper/2307.14430","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:3ed4217e6785d56deb083a6be05a7facc93e019773435335cc64d1f84a1181ad","observation_id":"32058b09-fae7-4ce8-bfc0-e861a5801d4b","resolution":{"observed_at":"2026-08-07T14:04:24.403499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08801","last_updated":"2020-07-28T15:12:38Z","snapshot_observed_at":"2026-08-09T10:19:01.229547Z","submitted_at":"2020-07-17T07:52:44Z","title":"Learning to Combine: Knowledge Aggregation for Multi-Source Domain Adaptation","version":3},"cited_work":{"arxiv_id":"2007.08801","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.08801","snapshot_observed_at":"2026-08-07T14:04:25.176334Z","title":"Learning to Combine: Knowledge Aggregation for Multi-Source Domain Adaptation","venue":"cs.CV","work_id":"d0ba9585-ee2e-4878-85fa-caa52c168760","year":2020},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.473199Z"},"links":{"cited_paper":"/paper/2007.08801","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:0549571afa3790658a2ef73e86f34383680e068ed85bb9b7d0ed5ef50900485c","observation_id":"1e101994-f756-4a34-9730-29927a129382","resolution":{"observed_at":"2026-08-07T14:04:25.253706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-13T05:09:57.542291Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T14:04:24.571162Z","title":"Efficient online data mixing for language model pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.571162Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:fa777dd5c86524582373e351b242f72715dd61c7eee6cfad4edd568e66345c3f","observation_id":"4f784259-f93c-48de-97e0-b32d974601ba","resolution":{"observed_at":"2026-08-07T14:04:24.571162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14048","last_updated":"2024-02-21T04:18:38Z","snapshot_observed_at":"2026-08-10T13:06:16.750257Z","submitted_at":"2021-10-26T22:03:51Z","title":"Conflict-Averse Gradient Descent for Multi-task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14048","snapshot_observed_at":"2026-08-07T14:04:24.642321Z","title":"Conflict-averse gradient descent for multi-task learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.642321Z"},"links":{"cited_paper":"/paper/2110.14048","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:9cce881f4436b71efe0bf68ea28ca1ef27f9f8bbaa8d20811a579a379aacc795","observation_id":"f8a9d79b-2215-444b-a291-5b99e7ab11d2","resolution":{"observed_at":"2026-08-07T14:04:24.642321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02257","last_updated":"2018-06-12T06:45:49Z","snapshot_observed_at":"2026-08-14T20:16:18.909353Z","submitted_at":"2017-11-07T02:08:12Z","title":"GradNorm: Gradient Normalization for Adaptive Loss Balancing in Deep Multitask Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02257","snapshot_observed_at":"2026-08-07T14:04:24.716563Z","title":"Gradnorm: Gradient normalization for adaptive loss balancing in deep multitask networks, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.716563Z"},"links":{"cited_paper":"/paper/1711.02257","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:6a343a34dc14f5ef5e0d1432d35dbd8a90a3568539a0ce31b9b568b37751bb8f","observation_id":"a31677a6-6ff4-49b5-a0c2-2baae3a7fd06","resolution":{"observed_at":"2026-08-07T14:04:24.716563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01017","last_updated":"2022-07-08T12:00:51Z","snapshot_observed_at":"2026-08-13T16:48:33.513314Z","submitted_at":"2022-02-02T13:21:53Z","title":"Multi-Task Learning as a Bargaining Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01017","snapshot_observed_at":"2026-08-07T14:04:24.809400Z","title":"Multi-task learning as a bargaining game, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.809400Z"},"links":{"cited_paper":"/paper/2202.01017","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:c8a70867452721001590a922c68812004cb174b5ab1c575ee701718f23da5d9b","observation_id":"1fa80b2f-9c0c-4312-ad17-8504c1af612b","resolution":{"observed_at":"2026-08-07T14:04:24.809400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:04:25.755062Z","title":"Multiple-gradient descent algorithm ( MGDA ) for multiobjective optimization","venue":null,"work_id":"15b8eda2-fef4-463f-91f0-2a73916e3b18","year":2012},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.912025Z"},"links":{"citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:862ab50fb4dac74a74b4dfcfe42e7db0f5dbc29903ae1b719d90f4cabf427cc3","observation_id":"3fbc81cf-d05b-4848-ae99-bc8f97745d6f","resolution":{"observed_at":"2026-08-07T14:04:25.848930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T14:04:24.977197Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.977197Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:b7f68d9fb7f102c3b7416bff1b5262f615c54eaf4b17e60b16731f6baf41048c","observation_id":"131c85fc-1716-4469-97cf-1d194ba1e879","resolution":{"observed_at":"2026-08-07T14:04:24.977197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:18:46.652708Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.20380."}