{"as_of":"2026-08-10T19:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08827223bbb2f5531c69f3158b8dc71550bebff3b0b918000f7a078549070909","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:35:45.144387Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.18771/citation-record","integrity":"/paper/2501.18771/integrity","json":"/paper/2501.18771/citation-record.json","paper":"/paper/2501.18771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.059341Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.059341Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:f0694e2ae85bcf848fadaf41723beb9077457e5f47f7fd9ad5c5c7adb6e8ead2","observation_id":"81ee31a4-ede3-421f-9a89-6d0575aa511b","resolution":{"observed_at":"2026-08-09T22:35:45.059341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17733","last_updated":"2024-02-27T18:09:36Z","snapshot_observed_at":"2026-07-06T17:36:23.851926Z","submitted_at":"2024-02-27T18:09:36Z","title":"Tower: An Open Multilingual Large Language Model for Translation-Related Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17733","snapshot_observed_at":"2026-08-09T22:35:45.064264Z","title":"M., Pombal, J., Guerreiro, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.064264Z"},"links":{"cited_paper":"/paper/2402.17733","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:1097cb77f55041320ba8a935996eee261698dc11e4ddbdb334e818e2680e0a91","observation_id":"cf260182-c407-487f-bf5a-3eab9e0696c2","resolution":{"observed_at":"2026-08-09T22:35:45.064264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.450551Z","title":null,"venue":null,"work_id":"eaef96e7-c345-42e9-8e38-b7b9d56eb754","year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.068809Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:a902bf880fed9c8b88ef69b5ee5c6735f20240b75f87f1e2a645b9aa1c46f849","observation_id":"ec3434a9-29fc-4871-9321-a4230e5b4fa5","resolution":{"observed_at":"2026-08-09T22:35:45.454052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-09T22:35:45.072685Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.072685Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:d9e3f36687346661c3db51d879aeeb5b4268dc648f8889899311c3696a19a707","observation_id":"b6de0e06-c0f6-4561-a774-e8e4c0b7971d","resolution":{"observed_at":"2026-08-09T22:35:45.072685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.wmt-1.5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Results of WMT 23 metrics shared task: Metrics might be guilty but references are not innocent","venue":null,"work_id":"846f81b9-d870-49f4-98aa-72b1d9fce861","year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.077315Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:56b5aede0a8536c802fc10118822c1587d84b86e1fbeeae946cdbd3085146425","observation_id":"09b43ad9-32c8-4c2c-9660-014c5228460b","resolution":{"observed_at":"2026-08-09T22:35:45.186621Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.081309Z","title":"The F lores-101 evaluation benchmark for low-resource and multilingual machine translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.081309Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:417223e8bb672fe863f724c9627aabab3ffb6061a3881e1e395c615146e74c32","observation_id":"f2672c02-d44d-4d9a-82e1-a4eef29d5431","resolution":{"observed_at":"2026-08-09T22:35:45.081309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-09T22:35:45.085387Z","title":"Z., Zhong, M., Schaeffer, R., Ouyang, S., Han, J., and Koyejo, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.085387Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:2b3ecccb61103bc96c6db57f5231fe099e775ec7bcfedc5dec2112f92a831fc2","observation_id":"af7211f0-4400-4785-bccb-b34ba2ed63fa","resolution":{"observed_at":"2026-08-09T22:35:45.085387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.090267Z","title":"M etric X -23: The G oogle submission to the WMT 2023 metrics shared task","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.090267Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:c5cb629a952bb21f0d79a5fc9a609662e0e583d2c49d1458aac749286077b41d","observation_id":"9608027c-02c0-44bb-be87-4b6eb08935a5","resolution":{"observed_at":"2026-08-09T22:35:45.090267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T22:35:45.094046Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.094046Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:e30b1a712619eec59515c1032133c743dbaf274a12a93105e312567ec1748294","observation_id":"96019eaa-ed2c-4170-bfa0-5c5526f4d9a1","resolution":{"observed_at":"2026-08-09T22:35:45.094046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.098252Z","title":"Findings of the 2023 conference on machine translation ( WMT 23): LLM s are here but not quite there yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.098252Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:f2067e357c9b72bdf60af41f8081cc702151ef30569908b8de89e5013f195daa","observation_id":"0e148f8f-0431-41ee-9e46-df3d2de8329a","resolution":{"observed_at":"2026-08-09T22:35:45.098252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.101914Z","title":"Findings of the WMT 24 general machine translation shared task: The LLM era is here but MT is not solved yet","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.101914Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:23a0c054c4f9ba08f054b7812e4a32bb7455f113ba875577403b1fdff2355dfb","observation_id":"428c447a-3be4-4046-91d3-67cb70e39e6e","resolution":{"observed_at":"2026-08-09T22:35:45.101914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-09T22:35:45.105659Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detokenizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.105659Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:0442d3699ef30f137ef7ca389cc76d3c797bbe0b7318f338b0c2224bd7d5fc6c","observation_id":"4b167f55-f31a-4a58-a8da-ea41249747bf","resolution":{"observed_at":"2026-08-09T22:35:45.105659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.427702Z","title":"Madlad-400: a multilingual and document-level large audited dataset","venue":null,"work_id":"2bfbb51b-22f3-4745-94f4-51d49e8dc5e3","year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.109756Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:f782a544fa3a2123b1f29d2f59cf2ba3f832afad0e3a1c47d1a285d8faab059e","observation_id":"4d1e0dbd-e66c-4a39-84a0-d770bef61d11","resolution":{"observed_at":"2026-08-09T22:35:45.431797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08242","last_updated":"2022-03-15T20:37:16Z","snapshot_observed_at":"2026-08-10T17:07:33.309729Z","submitted_at":"2022-03-15T20:37:16Z","title":"Data Contamination: From Memorization to Exploitation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.08242","snapshot_observed_at":"2026-08-09T22:35:45.113380Z","title":"and Schwartz, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.113380Z"},"links":{"cited_paper":"/paper/2203.08242","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:b53890f7fe35f4f01b0044044006897168e03e0446917ec369981c368412200b","observation_id":"32751535-6613-4025-894f-e9b7eed3917c","resolution":{"observed_at":"2026-08-09T22:35:45.113380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17623","last_updated":"2023-11-24T01:45:16Z","snapshot_observed_at":"2026-07-06T16:39:08.850847Z","submitted_at":"2023-10-26T17:43:13Z","title":"Proving Test Set Contamination in Black Box Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17623","snapshot_observed_at":"2026-08-09T22:35:45.117286Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.117286Z"},"links":{"cited_paper":"/paper/2310.17623","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:6076fa67cc6251ee9b91abfa850d5bdb0211d3dfe1219ffd7e90f2591a8fa550","observation_id":"c2f3c6fd-1ea6-42c7-93a5-4daaccee9f63","resolution":{"observed_at":"2026-08-09T22:35:45.117286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.121076Z","title":"B leu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.121076Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:4f0a61f7afab08a9c42fe168df28f32bc612258b41426599b8cb8dd420f536f7","observation_id":"cd27d577-d485-4558-b151-4cf56783ba3c","resolution":{"observed_at":"2026-08-09T22:35:45.121076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21530","last_updated":"2024-08-04T05:53:25Z","snapshot_observed_at":"2026-07-06T18:54:58.451463Z","submitted_at":"2024-07-31T11:26:57Z","title":"Data Contamination Report from the 2024 CONDA Shared Task","version":2},"cited_work":{"arxiv_id":"2407.21530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21530","snapshot_observed_at":"2026-08-09T22:35:45.233112Z","title":"Data Contamination Report from the 2024 CONDA Shared Task","venue":"cs.CL","work_id":"5b7ca6ff-4cc7-4f56-9687-e55eb1da641e","year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.124513Z"},"links":{"cited_paper":"/paper/2407.21530","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:4e194da3a4facd70d0c253c9f0c20faa41d0749b9e0a8fa9d4ff30a6deb55206","observation_id":"ab1e9976-e1a9-43a0-b805-cea319aded1d","resolution":{"observed_at":"2026-08-09T22:35:45.237824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-08-08T18:07:29.632928Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-09T22:35:45.128351Z","title":"Detecting pretraining data from large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.128351Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:0423758c7ae52758d9fd8dbc098b1fa52186ed3bb2eb5823bf0ef83fceb58fa3","observation_id":"41044f83-7225-41f4-82f9-28d7e2414548","resolution":{"observed_at":"2026-08-09T22:35:45.128351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-08-09T22:35:45.132126Z","title":"K., Kocyigit, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.132126Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:5be6c7b7fbae250ff6ecc018dd0d0076567a2a780129f583d9671f3e71f92094","observation_id":"aa2be92d-3aa0-4151-83b0-90cfc9250743","resolution":{"observed_at":"2026-08-09T22:35:45.132126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.135371Z","title":"Dolma: an open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.135371Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:b1ef1b90b5c708e0e88665a89345ba11a9cba2b9685ec2f288f2da0193254532","observation_id":"bcbaf847-3e5f-450e-9f1a-2e77704fc02f","resolution":{"observed_at":"2026-08-09T22:35:45.135371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:35:45.138456Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.138456Z"},"links":{"citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:9efc6c5cc05c9f8f36a250ccb29de75ab6d867b76aed47e39a61e854c4c97651","observation_id":"e903e07a-34cc-4dce-8345-835635a10ca7","resolution":{"observed_at":"2026-08-09T22:35:45.138456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-09T22:35:45.141387Z","title":"E., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.141387Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:b0d8809600edae0c97c4fa8b7298ccfeb654e30b91530c7cd357fc61eaabc2ba","observation_id":"ac7606fa-bfa5-4291-b7d0-361a84b6553a","resolution":{"observed_at":"2026-08-09T22:35:45.141387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-09T22:35:45.144387Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T22:35:45.144387Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2501.18771"},"observation_digest":"sha256:9ccf255ba8f0400603d452f7637e7b105ebb90089c62c61dc3e7be52a3b6784a","observation_id":"11b8b444-9008-475b-97b5-361819185eb7","resolution":{"observed_at":"2026-08-09T22:35:45.144387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18771","last_updated":"2025-01-30T21:51:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T16:10:45.018271Z","submitted_at":"2025-01-30T21:51:18Z","title":"Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2501.18771."}