{"as_of":"2026-08-10T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e77ab13ca6e87bdfc26a145b8a90776da4c7121cae4387e486e34e43c51ef7dc","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:42:57.897301Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12966/citation-record","integrity":"/paper/2506.12966/integrity","json":"/paper/2506.12966/citation-record.json","paper":"/paper/2506.12966"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-07T00:42:57.678997Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.678997Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:a1933eca344c58e23203b1ee20de741ccb722301c04a6970f05accf579cb810d","observation_id":"19e10aa8-8f48-4ad9-acc6-39383ad206b2","resolution":{"observed_at":"2026-08-07T00:42:57.678997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T00:42:57.682945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.682945Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:1bdde7d19dad838ffa1d213e9e373e08b49bfa23926cbf47efd8b2b7f8cfdcff","observation_id":"8492cab4-8e93-46d5-a0fa-f642c08eb7aa","resolution":{"observed_at":"2026-08-07T00:42:57.682945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.686305Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.686305Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:15ae4f573a4e77278cc4e7655bf625014b731a682bd47df3c619250641983b7e","observation_id":"0b688615-786d-42ca-8b2d-a3f0f4988e79","resolution":{"observed_at":"2026-08-07T00:42:57.686305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.593267Z","title":null,"venue":null,"work_id":"b39975cb-08d8-4663-81ba-21e4176909b1","year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.689369Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:713de939e338fb00a5da52088f067218be27960207d71c0e3013cfe3a951e0a1","observation_id":"26f975fb-6e97-42c2-aaf8-0205b6384de2","resolution":{"observed_at":"2026-08-07T00:42:58.596188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.692443Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.692443Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:a20fc80c7f3dea594147309c97475e24fea9400e2d3be85a90905225c9e2b515","observation_id":"16cc4ac3-a93e-4392-8223-59f55cca65e3","resolution":{"observed_at":"2026-08-07T00:42:57.692443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T00:42:57.695463Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.695463Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:dc8d1a6c8d24fa38c9ba5a1ffead0b135ecdb237eb269dc369e7a68141825d85","observation_id":"3c82927a-0655-43f5-a95a-2a5ab813159d","resolution":{"observed_at":"2026-08-07T00:42:57.695463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.578882Z","title":null,"venue":null,"work_id":"0d37cf27-49af-43e8-b889-e1af7a4b1be2","year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.698942Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:f98935ee9956f5f3d0d129ee6136b3c3aef0789a45b932dbd1ac1047900ac37f","observation_id":"87e4f279-d2c1-4846-a36c-8b9d9dc42ade","resolution":{"observed_at":"2026-08-07T00:42:58.582525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09205","last_updated":"2023-11-15T18:47:42Z","snapshot_observed_at":"2026-08-03T02:17:16.396973Z","submitted_at":"2023-11-15T18:47:42Z","title":"When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09205","snapshot_observed_at":"2026-08-07T00:42:57.702080Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.702080Z"},"links":{"cited_paper":"/paper/2311.09205","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:663a8c4e99e8c9709aeb5bfad48b0352b829e336c4017faabc34ef2db141c726","observation_id":"c8be4aa1-aff1-4c5b-b9ce-dfb73643cfb0","resolution":{"observed_at":"2026-08-07T00:42:57.702080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T00:42:57.705129Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.705129Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3f756d89b9a8c9b14b62caddc82239428be5e856dcd91e97f2b19604570c8c2f","observation_id":"be49ab56-1e88-44f5-95ec-22ad342f1f0a","resolution":{"observed_at":"2026-08-07T00:42:57.705129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.569381Z","title":null,"venue":null,"work_id":"af6b5ca0-6433-4a36-b636-add037fb45f0","year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.708382Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:9a931bf952d05a878080c8174c350c1a5d766e44b15f92f3e0c60ecff9750d36","observation_id":"8e6f38c6-2882-4d29-99d9-8ec7f4d2dc85","resolution":{"observed_at":"2026-08-07T00:42:58.573207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.560147Z","title":null,"venue":null,"work_id":"bdd79368-74e4-4715-903e-4db621237d81","year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.711204Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:dac7dee8e4ee7d2df65d19844dc6bd578cf3ab0e1f6129848268979e6fe507eb","observation_id":"bd77cb8e-df47-43f1-bc6a-1bdf96087aeb","resolution":{"observed_at":"2026-08-07T00:42:58.563158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05053","last_updated":"2018-09-13T16:39:53Z","snapshot_observed_at":"2026-08-07T19:31:05.439791Z","submitted_at":"2018-09-13T16:39:53Z","title":"XNLI: Evaluating Cross-lingual Sentence Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.05053","snapshot_observed_at":"2026-08-07T00:42:57.714092Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.714092Z"},"links":{"cited_paper":"/paper/1809.05053","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:c477458bcb62f7b17d51164f4c46ce8ef9b5a23e428d47fa65fbd045ddca25f6","observation_id":"1a930c05-1323-433a-9ead-78b3d83c9723","resolution":{"observed_at":"2026-08-07T00:42:57.714092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.09582","last_updated":"2019-12-19T22:59:26Z","snapshot_observed_at":"2026-08-09T12:00:08.868509Z","submitted_at":"2019-12-19T22:59:26Z","title":"BERTje: A Dutch BERT Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.09582","snapshot_observed_at":"2026-08-07T00:42:57.717189Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.717189Z"},"links":{"cited_paper":"/paper/1912.09582","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:d558a9747b8985edc0715e0ee21e22e862c28c610d03e087df5aba6d1318cb59","observation_id":"edf2962f-5c3c-4363-b661-b7eda1805cef","resolution":{"observed_at":"2026-08-07T00:42:57.717189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.720246Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.720246Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:d0daaa3fa313fb19f22259fb39225b907d4f10eedbb93dc463bb3ec5a80653b6","observation_id":"4367cf7b-bc18-48b0-ab71-9c9aab0ca59d","resolution":{"observed_at":"2026-08-07T00:42:57.720246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-09T06:27:27.325450Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-07T00:42:57.723303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.723303Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:5829f57f9edcad0623b19672db033df0e4865e0eb4a90993abe29b9265051869","observation_id":"87cb0481-1866-4cfe-b0eb-202b06052e3c","resolution":{"observed_at":"2026-08-07T00:42:57.723303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00786","last_updated":"2025-04-09T09:45:01Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T17:17:55Z","title":"CroissantLLM: A Truly Bilingual French-English Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00786","snapshot_observed_at":"2026-08-07T00:42:57.726728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.726728Z"},"links":{"cited_paper":"/paper/2402.00786","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:89e2c242a2deb00614fb0531fbce2d34548285aacb3e841feae24e486f97a7f3","observation_id":"fcb7579c-0f9c-4bc9-8181-808815bc67d7","resolution":{"observed_at":"2026-08-07T00:42:57.726728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.729710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.729710Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:7ccb5d9855a2093a2e82467916af60b4cef5b52a295d1224c2101efa7d31183f","observation_id":"252333cc-5137-4d41-88d9-4a80e6506540","resolution":{"observed_at":"2026-08-07T00:42:57.729710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03735","last_updated":"2025-03-11T00:20:30Z","snapshot_observed_at":"2026-08-09T06:27:43.634379Z","submitted_at":"2024-09-30T20:49:54Z","title":"Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03735","snapshot_observed_at":"2026-08-07T00:42:57.732570Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.732570Z"},"links":{"cited_paper":"/paper/2410.03735","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:0628ec2384f85ccd1cb5e868a542212de98c2db891e508690341f5c0face84a9","observation_id":"74951000-d1e7-44b6-bd03-72c9a584ee1f","resolution":{"observed_at":"2026-08-07T00:42:57.732570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01093","last_updated":"2024-10-31T15:56:08Z","snapshot_observed_at":"2026-08-06T06:47:05.941533Z","submitted_at":"2024-02-02T01:45:18Z","title":"Need a Small Specialized Language Model? Plan Early!","version":2},"cited_work":{"arxiv_id":"2402.01093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.01093","snapshot_observed_at":"2026-08-07T00:42:58.339549Z","title":"Need a Small Specialized Language Model? Plan Early!","venue":"cs.LG","work_id":"1de60e3d-598b-476c-9182-a34bad8a9f82","year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.735666Z"},"links":{"cited_paper":"/paper/2402.01093","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:7581a6122c64e88d206bf87d7c6ad77521d85d3dcacdf965325ac143571a3a52","observation_id":"5dd6597e-952c-4e1f-94b0-6564ae04b4d2","resolution":{"observed_at":"2026-08-07T00:42:58.343063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.546297Z","title":null,"venue":null,"work_id":"19db0cf0-bb9b-4ecf-b5fd-c241da460895","year":2022},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.738598Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:93f7ce050f62fb8dd4e50c408828ed3f279971328791be4025956db1b0f2d165","observation_id":"9ae5b1c7-af42-4dcc-a09b-70d1d19df9a0","resolution":{"observed_at":"2026-08-07T00:42:58.549357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T00:42:57.741420Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.741420Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:0e32ad4c0aadbc67e6a5692d59699121f4ddf9c35b58a911044c3b2f361752a2","observation_id":"5ebac441-02c5-491a-9cab-c0d4a3b672b4","resolution":{"observed_at":"2026-08-07T00:42:57.741420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T00:42:57.744315Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.744315Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3a386ff6aa0b692497881efb59c134e588b9a7afb8a9a7deefce33ff7d1f740f","observation_id":"36ef9f48-4eac-41e8-94ce-09c36b6f2ebb","resolution":{"observed_at":"2026-08-07T00:42:57.744315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07291","last_updated":"2019-01-22T13:22:34Z","snapshot_observed_at":"2026-08-09T08:50:16.800562Z","submitted_at":"2019-01-22T13:22:34Z","title":"Cross-lingual Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07291","snapshot_observed_at":"2026-08-07T00:42:57.747196Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.747196Z"},"links":{"cited_paper":"/paper/1901.07291","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:24b573ad027f09e45dd8cd4335186f8186223a39326486a9661cabb516dddde9","observation_id":"7fbc1e36-aebc-4570-ad3c-dbc8f4a0fc60","resolution":{"observed_at":"2026-08-07T00:42:57.747196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05372","last_updated":"2020-03-12T23:58:56Z","snapshot_observed_at":"2026-07-06T08:43:46.907186Z","submitted_at":"2019-12-11T14:59:32Z","title":"FlauBERT: Unsupervised Language Model Pre-training for French","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05372","snapshot_observed_at":"2026-08-07T00:42:57.750973Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.750973Z"},"links":{"cited_paper":"/paper/1912.05372","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:9b190d5572adb24290254ddf9473b6a8b0352d3b24b51ab1b4673d87f07c3b5c","observation_id":"7c49e436-26c5-4713-9251-b26a0e56857f","resolution":{"observed_at":"2026-08-07T00:42:57.750973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-07T00:42:57.754409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.754409Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:75c885978489f16357fb1ce3baaa4e11cc2ca9b6922b7c5bbc11c20e143682ed","observation_id":"e39326f9-71d5-41ee-b157-b6db59f1b660","resolution":{"observed_at":"2026-08-07T00:42:57.754409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-07T00:42:57.758129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.758129Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:67fdd6c691e1fb6dd03a54d9acd1e28a909a74990d7c31d5b462ea2756573904","observation_id":"9d62ae17-3757-4b83-b0cd-4ec73fa20f0c","resolution":{"observed_at":"2026-08-07T00:42:57.758129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16380","last_updated":"2024-01-29T18:19:08Z","snapshot_observed_at":"2026-08-09T00:44:38.653719Z","submitted_at":"2024-01-29T18:19:08Z","title":"Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16380","snapshot_observed_at":"2026-08-07T00:42:57.762055Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.762055Z"},"links":{"cited_paper":"/paper/2401.16380","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:4db5158e7d0a59405fada99fece933ba235ac708af0229179f05e9d00d112271","observation_id":"91dfd06b-e4fa-466a-a3dd-78dcc7940c74","resolution":{"observed_at":"2026-08-07T00:42:57.762055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03894","last_updated":"2020-05-21T23:20:48Z","snapshot_observed_at":"2026-08-07T18:38:04.367968Z","submitted_at":"2019-11-10T10:46:37Z","title":"CamemBERT: a Tasty French Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03894","snapshot_observed_at":"2026-08-07T00:42:57.764947Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.764947Z"},"links":{"cited_paper":"/paper/1911.03894","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:5894d203a91ac3fbe2894781733271a767b9eefdcd12cfd5a53994e22e208f7e","observation_id":"6f410068-c866-4b3b-a6bf-746590d5c63d","resolution":{"observed_at":"2026-08-07T00:42:57.764947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-07T00:42:57.768012Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.768012Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:af4ba189ecfd6493ef1cedae66fc996b7f3035a59bbbe741ca3d4c34839d9faa","observation_id":"7e9306f7-eb18-40b8-8ac6-fe1facb3aec8","resolution":{"observed_at":"2026-08-07T00:42:57.768012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.771955Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.771955Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:f06b9a20966f143a5b7bfa8806c7de8b676242d70f10a770012a9a041857b1c1","observation_id":"1a3c418d-a087-4613-b738-4bab143345bb","resolution":{"observed_at":"2026-08-07T00:42:57.771955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.537746Z","title":null,"venue":null,"work_id":"b167d1ab-2143-48cd-8033-d746a6958acc","year":2021},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.774753Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:5e37253a9f15d75e7a5b91ee90b05a77eee4bf933e14d4218cc6f120e25b4e14","observation_id":"1f310d4e-7643-4ba0-97f5-95e1570309f4","resolution":{"observed_at":"2026-08-07T00:42:58.540712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.777504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.777504Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:7d7d33487302d9531254b4a48afcec53aae64ffd2e93216ea60335ffc60d9528","observation_id":"0cda0ffc-dfce-4e1c-8c97-3a6d2b0ecd51","resolution":{"observed_at":"2026-08-07T00:42:57.777504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.524022Z","title":null,"venue":null,"work_id":"6bd6142f-1976-49c2-b401-677a4d3e5d7b","year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.780271Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:c3e9886ef22d0e15d0b913d18088af68ec4b60590d847f28f28185e83caa1a66","observation_id":"23b42dec-d1cb-4dd7-ab9a-bca1c4d02f12","resolution":{"observed_at":"2026-08-07T00:42:58.527033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:42:57.783020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.783020Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:706b711a994d5f723845b92d2ca3075012f15caca4bb4bcea60fc6d0aadd871a","observation_id":"1b6f2d53-07ee-4508-ac88-aa771e65f5fc","resolution":{"observed_at":"2026-08-07T00:42:57.783020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-07T00:42:57.785958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.785958Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:c0a02d471b785788ab365336372f84bedd4e2c71416d66e9959b0e9412232439","observation_id":"0fde24a5-d231-435e-ba90-e8b3826c700b","resolution":{"observed_at":"2026-08-07T00:42:57.785958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.514109Z","title":null,"venue":null,"work_id":"a26aa5f7-f2a1-456f-9c8a-4eeb247aea88","year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.788980Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:d57d68e6cbf3ab58fc5a1438241f80783b09f256cdd6dc96c26b99465b46135c","observation_id":"9bffbdd3-078d-488c-bf68-b36a5b5c23f6","resolution":{"observed_at":"2026-08-07T00:42:58.517600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-07T00:42:57.791878Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.791878Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:558845238d008b7e40a65a426763dc406693148425cd741c9acdeb06ed9459fe","observation_id":"8a273ba9-d68c-4b45-89b9-2ba9fb2a8cb9","resolution":{"observed_at":"2026-08-07T00:42:57.791878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.505167Z","title":null,"venue":null,"work_id":"1f2a871e-dcd7-4327-9f71-d31beca3b2ed","year":2022},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.794905Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:382529592daf425570b546d07968d306312ef20a2bcbfcc85ba31dcf79e388f0","observation_id":"659fa60b-f619-4c9d-94de-91261b56a568","resolution":{"observed_at":"2026-08-07T00:42:58.508638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.797789Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.797789Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:e0f20cd3feac5f6007e234615a77091f83c4c77476e52e6bd21b0288fe3e3231","observation_id":"017d68ce-4dc5-473c-af35-ac39bfe3c241","resolution":{"observed_at":"2026-08-07T00:42:57.797789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T00:42:57.801113Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.801113Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:f2e45c49bcd5dadfd37f2623f7524b2f980fa505508dd5e390767fd632ae545b","observation_id":"97613eb6-f2fa-4cbc-afae-e6b8144e73d4","resolution":{"observed_at":"2026-08-07T00:42:57.801113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.804150Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.804150Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:0de4de869b01f317bcbad848fb5d8b49cbcce2d508c368c77d6851308590481e","observation_id":"940c4a9a-5063-429e-8ba0-425ad30cdba9","resolution":{"observed_at":"2026-08-07T00:42:57.804150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T00:42:57.807659Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.807659Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:24952fe537a05a6be0d1ab3cdf5568e0cf25e10770f7b4a2168cf5c6dc6f9fa3","observation_id":"4992e0d0-52bc-42c8-9b91-200cba6ff621","resolution":{"observed_at":"2026-08-07T00:42:57.807659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.486122Z","title":null,"venue":null,"work_id":"bc2fc9c1-3b17-4c3c-8970-a8fb60d81ccb","year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.811840Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:5f8aedeef99249107ed10448362b6c8383629d55a50df68427cf37bf60c40ad6","observation_id":"e8e2f4e5-5dcc-42e2-b635-63c728731bce","resolution":{"observed_at":"2026-08-07T00:42:58.489068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19799","last_updated":"2024-11-29T16:03:14Z","snapshot_observed_at":"2026-07-06T19:58:57.119904Z","submitted_at":"2024-11-29T16:03:14Z","title":"INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19799","snapshot_observed_at":"2026-08-07T00:42:57.815032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.815032Z"},"links":{"cited_paper":"/paper/2411.19799","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:91108a7fb1d0ad3006d586a1d795b6f8d3ead44714cf684ba8925f63f49c63fc","observation_id":"5437ef72-b8ec-4016-a952-2d27b2416467","resolution":{"observed_at":"2026-08-07T00:42:57.815032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.476013Z","title":null,"venue":null,"work_id":"fbb426bf-d984-410e-a041-e16df4c10ab4","year":2021},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.818287Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:d211ba6281703819f8c33f00a368b9595b6191c8d935661390ba9a13c6a3df8a","observation_id":"e96b0208-2484-4d36-932f-4573aaeba327","resolution":{"observed_at":"2026-08-07T00:42:58.479753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-07T00:42:57.821522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.821522Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:a85f9710f32a83a197a2631fed0dbfdb750d4c30928ea1a10dbfcca7df6e2c4f","observation_id":"2a1f4957-80ec-4cd3-a2fd-c1a72c8777ca","resolution":{"observed_at":"2026-08-07T00:42:57.821522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.824449Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.824449Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:b1fea305a08c2ab314196de6f820e9b13d729117d4cd4da172e0a21ad862d457","observation_id":"eafa7136-9498-415f-a5ad-7644a4259ec0","resolution":{"observed_at":"2026-08-07T00:42:57.824449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07072","last_updated":"2025-04-29T07:52:17Z","snapshot_observed_at":"2026-08-07T16:07:07.289179Z","submitted_at":"2025-04-09T17:43:16Z","title":"Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07072","snapshot_observed_at":"2026-08-07T00:42:57.827390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.827390Z"},"links":{"cited_paper":"/paper/2504.07072","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3ecdcca7917f0ad28d6e13d5b6b37caf8eb67c43b913aff3ac9d1034605a402c","observation_id":"6f457593-7804-4e57-8b38-8f836b9631a1","resolution":{"observed_at":"2026-08-07T00:42:57.827390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02110","last_updated":"2026-06-01T09:18:34Z","snapshot_observed_at":"2026-08-05T16:56:28.587123Z","submitted_at":"2020-12-03T17:45:03Z","title":"GottBERT: a pure German Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.02110","snapshot_observed_at":"2026-08-07T00:42:57.831002Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.831002Z"},"links":{"cited_paper":"/paper/2012.02110","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:40cee00cdbeb11a9998e51aa1ee983c2b21b46ad7b0b5242e5fa46324aa0626b","observation_id":"0329e8f9-aa75-4bee-aaa2-948a465fd338","resolution":{"observed_at":"2026-08-07T00:42:57.831002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12986","last_updated":"2025-02-06T03:36:12Z","snapshot_observed_at":"2026-07-06T19:52:55.369337Z","submitted_at":"2024-11-20T02:27:40Z","title":"Training Bilingual LMs with Data Constraints in the Targeted Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12986","snapshot_observed_at":"2026-08-07T00:42:57.834986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.834986Z"},"links":{"cited_paper":"/paper/2411.12986","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:50a512ab868406a148969cf2fc0a426b19c2e84f83f233c883ec1eb6465d5e1b","observation_id":"1d5c8e57-8b08-4aee-b4fd-57ee619cc5e1","resolution":{"observed_at":"2026-08-07T00:42:57.834986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-08-09T14:26:53.957065Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-07T00:42:57.838419Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.838419Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:7322b64ddd02d583f76073b8f6c6329d6801f460c84ce1e7022f50e8bc67d7e2","observation_id":"2e4f09a6-3cb8-4470-b781-1d5bc1f8de0f","resolution":{"observed_at":"2026-08-07T00:42:57.838419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.461151Z","title":null,"venue":null,"work_id":"aeb17083-a9cc-445b-9cb3-119efc191522","year":2017},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.842111Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3ce9e72dba065b68ef4d585f7db7e07110f98bb97fb1d0a53dc34afb68746efb","observation_id":"77a551dd-6412-4b1c-9020-47b8c91f2885","resolution":{"observed_at":"2026-08-07T00:42:58.464659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T00:42:57.845214Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.845214Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:222aed8671ccd76c401db875b84cebdf2ad7adb35c6320562144e770157adda0","observation_id":"3e29ea60-1839-4d1b-8d10-b1e03238b333","resolution":{"observed_at":"2026-08-07T00:42:57.845214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:42:57.848674Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.848674Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:a04049131588dab9bc4d2ad6ca95ab37e7e22d787414250aa001747daefe07aa","observation_id":"c711d598-9d25-4aa5-9f6d-836584964893","resolution":{"observed_at":"2026-08-07T00:42:57.848674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.851755Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.851755Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:cc016eb5c3c5b695d53a27fc504a3fec75805d7e6b358f792d15293d58e2191e","observation_id":"d6ba6820-4bb5-4fe3-a919-a1e11348a819","resolution":{"observed_at":"2026-08-07T00:42:57.851755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13252","last_updated":"2025-02-18T19:27:53Z","snapshot_observed_at":"2026-08-07T20:49:16.565862Z","submitted_at":"2025-02-18T19:27:53Z","title":"Multilingual Language Model Pretraining using Machine-translated Data","version":1},"cited_work":{"arxiv_id":"2502.13252","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13252","snapshot_observed_at":"2026-08-07T00:42:58.000697Z","title":"Multilingual Language Model Pretraining using Machine-translated Data","venue":"cs.CL","work_id":"d8e799ed-8878-4c99-9ff1-1220cde5e957","year":2025},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.855545Z"},"links":{"cited_paper":"/paper/2502.13252","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3d83bd5c590432e60c309b627833d201cd1f24823eb47ff47daf2ee085efa38e","observation_id":"ccfa743a-230a-4d60-b987-765b68c9c86c","resolution":{"observed_at":"2026-08-07T00:42:58.006519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03017","last_updated":"2020-10-06T20:48:58Z","snapshot_observed_at":"2026-08-09T19:15:21.075488Z","submitted_at":"2020-10-06T20:48:58Z","title":"On Negative Interference in Multilingual Models: Findings and A Meta-Learning Treatment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03017","snapshot_observed_at":"2026-08-07T00:42:57.858586Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.858586Z"},"links":{"cited_paper":"/paper/2010.03017","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:1c2612997a48355aab519471b413bc080da1c68330528a6c9e83d7becbb64466","observation_id":"2447c5ed-cb2a-4f6a-9305-59907cfc0201","resolution":{"observed_at":"2026-08-07T00:42:57.858586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.446862Z","title":null,"venue":null,"work_id":"184be0bb-44d4-4ecc-b234-e960e2f92c5c","year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.861630Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:34fe0de3ccc3cc59a51f4789fa31b762dfd43fc5d7bb9a1330bd549da827557b","observation_id":"99b9aa3e-39bf-4d1e-866f-830f66a59ede","resolution":{"observed_at":"2026-08-07T00:42:58.450048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19341","last_updated":"2023-10-30T08:31:47Z","snapshot_observed_at":"2026-08-06T06:09:43.812715Z","submitted_at":"2023-10-30T08:31:47Z","title":"Skywork: A More Open Bilingual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19341","snapshot_observed_at":"2026-08-07T00:42:57.864902Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.864902Z"},"links":{"cited_paper":"/paper/2310.19341","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:a05510f2839aac7121d3a8a80bfdd7438aee51b43adda36db08b0255ea76b620","observation_id":"e1335c21-2f55-469e-bf36-2539b2e9846f","resolution":{"observed_at":"2026-08-07T00:42:57.864902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06018","last_updated":"2023-07-12T09:00:37Z","snapshot_observed_at":"2026-07-06T15:53:07.429379Z","submitted_at":"2023-07-12T09:00:37Z","title":"PolyLM: An Open Source Polyglot Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06018","snapshot_observed_at":"2026-08-07T00:42:57.868407Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.868407Z"},"links":{"cited_paper":"/paper/2307.06018","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:eaa3567f43e9a93cca6aa5d7765ee01d5d30a5531c6d331c5611dbbef1c69e51","observation_id":"8a5b9c67-db08-47d1-b20e-da785c1ec632","resolution":{"observed_at":"2026-08-07T00:42:57.868407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-07T00:42:57.871494Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.871494Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:2fbe2e3a15ddb81c957329146f347803eddb0bfe2b860bdc9bd66e0a89a9d604","observation_id":"e38ef320-5a14-4a03-880a-a7a54fcef4b7","resolution":{"observed_at":"2026-08-07T00:42:57.871494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:58.438105Z","title":null,"venue":null,"work_id":"2d0c8d3c-d873-4bce-bc30-9aac89eb5ba9","year":2020},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.874570Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:befc470fdc0817d3747b076981ff93daa9d29dc1cc9309ced182a315cafefb5f","observation_id":"fe484e6b-e2fc-4ad8-b2a2-dc74baa2b40e","resolution":{"observed_at":"2026-08-07T00:42:58.441013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T00:42:57.877892Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.877892Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:3ee20488cae42b94da3318e245121b8977a2ef2579a65e3bd2f7fc35a3b5cb0d","observation_id":"e8333cd2-39ae-42c4-b724-34d34e568149","resolution":{"observed_at":"2026-08-07T00:42:57.877892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.881428Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.881428Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:698405bc0bff6ac0d617339d319066da877ad3d4989f33f7b5ff0ddba5a0df51","observation_id":"5794ef06-ff4f-43d4-b2ad-44f97cac0d40","resolution":{"observed_at":"2026-08-07T00:42:57.881428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00929","last_updated":"2024-12-09T14:30:11Z","snapshot_observed_at":"2026-07-06T17:53:51.988186Z","submitted_at":"2024-04-01T05:13:56Z","title":"A Survey on Multilingual Large Language Models: Corpora, Alignment, and Bias","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00929","snapshot_observed_at":"2026-08-07T00:42:57.884626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.884626Z"},"links":{"cited_paper":"/paper/2404.00929","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:e101c25c4ebf1b8263ce952fda9066b37fd9e81dda5c582d3e4cd922547cf7b8","observation_id":"9d73964d-030f-4625-b3df-181dc6fc9a69","resolution":{"observed_at":"2026-08-07T00:42:57.884626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:42:57.887628Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.887628Z"},"links":{"citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:5eb2330d85c5b250114251540054d0718c9493d9c8b303cb2674c869c5e52ae5","observation_id":"31d16081-235c-451c-a81b-a1157cdb7acf","resolution":{"observed_at":"2026-08-07T00:42:57.887628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:42:57.890575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.890575Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:9c58b75415ae04a6146dc82af3855e100f4dbeb83bea035ad1e29ccc234e047d","observation_id":"fb8e36ff-92fc-4ea6-9a78-a35a80787347","resolution":{"observed_at":"2026-08-07T00:42:57.890575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08197","last_updated":"2025-01-14T15:22:47Z","snapshot_observed_at":"2026-08-04T16:44:16.246690Z","submitted_at":"2025-01-14T15:22:47Z","title":"OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08197","snapshot_observed_at":"2026-08-07T00:42:57.893420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.893420Z"},"links":{"cited_paper":"/paper/2501.08197","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:fb93dfb219c3350050f99e9d9050bba48e01a8474ffa5c2eb38af4c534b3670a","observation_id":"d6180338-c7c0-4590-8908-2a9abcfcff23","resolution":{"observed_at":"2026-08-07T00:42:57.893420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T00:42:57.897301Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:57.897301Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.12966"},"observation_digest":"sha256:80f41d0d5eac5cd6d7277cfa107cf89c19d8550c609b62aaa809188459785f4a","observation_id":"4e2dba96-8d94-4ad7-b084-5ab2aeecc60d","resolution":{"observed_at":"2026-08-07T00:42:57.897301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12966","last_updated":"2025-06-15T21:08:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T21:39:58.375574Z","submitted_at":"2025-06-15T21:08:51Z","title":"Assessing the Role of Data Quality in Training Bilingual Language Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2506.12966."}