{"as_of":"2026-08-17T08:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f1ebd84d8c29da8dacc41a97eeca50e7fb3cb69e763b9f4931347f952f2cb96","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:57:59.321417Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:13.400147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:11:14.121736Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"cited_work":{"arxiv_id":"2411.13775","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.13775","snapshot_observed_at":"2026-08-07T12:11:14.121736Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","venue":"cs.CL","work_id":"3920df95-cedf-4af0-a910-141f54bcdc99","year":2024},"citing_paper":{"arxiv_id":"2506.00418","last_updated":"2025-06-21T07:56:37Z","snapshot_observed_at":"2026-08-09T23:03:24.827545Z","submitted_at":"2025-05-31T06:44:48Z","title":"Dual Debiasing for Noisy In-Context Learning for Text Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:13.400147Z"},"links":{"cited_paper":"/paper/2411.13775","citing_paper":"/paper/2506.00418"},"observation_digest":"sha256:d43885998f7c9477b582cb8199ae05df1ec5616407050ee3755eb1338e5f81d3","observation_id":"44a04cea-a814-4844-97a7-edf5517ed247","resolution":{"observed_at":"2026-08-07T12:11:14.152040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13775/citation-record","integrity":"/paper/2411.13775/integrity","json":"/paper/2411.13775/citation-record.json","paper":"/paper/2411.13775"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.08745","last_updated":"2023-11-02T07:19:37Z","snapshot_observed_at":"2026-08-16T16:01:13.784064Z","submitted_at":"2023-01-20T08:51:36Z","title":"Is ChatGPT A Good Translator? Yes With GPT-4 As The Engine","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08745","snapshot_observed_at":"2026-08-12T15:57:59.020774Z","title":"Is chatgpt a good translator? yes with gpt-4 as the engine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.020774Z"},"links":{"cited_paper":"/paper/2301.08745","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:cfda23feb06c0464532b198ac820e7669818149ab15b29df6d6bb695b875ad80","observation_id":"9d0efe89-a40c-431e-ac48-ae31a1f1696b","resolution":{"observed_at":"2026-08-12T15:57:59.020774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.464465Z","title":"Document-level machine translation with large language models,","venue":null,"work_id":"7c1871fd-24b5-4732-b615-0de4cc9105bc","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.027455Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:fb40b7604da99856aaaac42091a5eb25498961ced7d973812eb420cf82d3f250","observation_id":"bbe487d5-a951-413b-8d0f-309c9bad3bdc","resolution":{"observed_at":"2026-08-12T15:58:00.469453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13813","last_updated":"2024-04-22T01:22:23Z","snapshot_observed_at":"2026-08-16T13:59:03.810116Z","submitted_at":"2024-04-22T01:22:23Z","title":"From LLM to NMT: Advancing Low-Resource Machine Translation with Claude","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13813","snapshot_observed_at":"2026-08-12T15:57:59.033093Z","title":"From llm to nmt: Advancing low-resource machine translation with claude,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.033093Z"},"links":{"cited_paper":"/paper/2404.13813","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:10aa505af07900acac4cdafc4b533a77b78f2ea4f6143c47320b9a7ac877bc19","observation_id":"63042b39-a464-43cb-b053-733fbb546681","resolution":{"observed_at":"2026-08-12T15:57:59.033093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.447297Z","title":"Towards making the most of llm for translation quality estimation,","venue":null,"work_id":"4a2abaf3-aceb-4bfc-ba1b-f968a2670fdc","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.042943Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:90a79e13715a405a62c2e9dfa45e2563ddfb3e827d68f909fa7c2a7da303695b","observation_id":"a624b256-c8a9-4ddf-911b-268ae80c9198","resolution":{"observed_at":"2026-08-12T15:58:00.453133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06468","last_updated":"2024-10-11T10:48:15Z","snapshot_observed_at":"2026-08-16T14:28:00.314741Z","submitted_at":"2024-01-12T09:29:13Z","title":"Adapting Large Language Models for Document-Level Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06468","snapshot_observed_at":"2026-08-12T15:57:59.049681Z","title":"Adapting large language models for document-level machine translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.049681Z"},"links":{"cited_paper":"/paper/2401.06468","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:a1cd553fe3ded0dedc2c8dc62006979cceef9c3985647d3efcf295b0a44080e7","observation_id":"94d8dc8e-2b00-467b-be11-163a05b6a8d9","resolution":{"observed_at":"2026-08-12T15:57:59.049681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09210","last_updated":"2023-02-18T02:11:36Z","snapshot_observed_at":"2026-08-17T05:42:24.349196Z","submitted_at":"2023-02-18T02:11:36Z","title":"How Good Are GPT Models at Machine Translation? A Comprehensive Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09210","snapshot_observed_at":"2026-08-12T15:57:59.057405Z","title":"How good are gpt models at machine translation? a com- prehensive evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.057405Z"},"links":{"cited_paper":"/paper/2302.09210","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:80b71d5cdf0abec796b1b7882ccb56b016386b9f147eb0d43c60af5691aae60d","observation_id":"040dfe16-cf74-4f4d-ab1e-ea2f7f7491ce","resolution":{"observed_at":"2026-08-12T15:57:59.057405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.430598Z","title":"Towards making the most of chatgpt for machine translation,","venue":null,"work_id":"3df4e901-4b1d-4c5a-a60f-1bb5b27ec6e2","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.064112Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:3728193c4cd7a97f216e9f0504ed4753337611fe3dfd43917a6b993ef607d8a4","observation_id":"2eed2e66-825f-4584-b336-3d59179f807f","resolution":{"observed_at":"2026-08-12T15:58:00.436179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.414248Z","title":"What is the best way for ChatGPT to translate poetry?","venue":null,"work_id":"d13b9c05-369c-4c95-be88-c92b97c95431","year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.075239Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:4f5b6e8362cee88512d08390b9113d9fec38f959bc790c5dd684d0534bc6396c","observation_id":"4521e6fd-a7a4-4801-a42e-e6e01c5d95b5","resolution":{"observed_at":"2026-08-12T15:58:00.419264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.398682Z","title":"Revisiting cross- lingual summarization: A corpus-based study and a new benchmark with improved annotation","venue":null,"work_id":"ec59053a-92f6-46ae-8ab1-177125c0f0cf","year":null},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.080774Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:a018203f88ef18a0d9e936976d54bac27f8429d1815e8e9f114d11bb9d4bdb68","observation_id":"40392461-fb42-4707-a20c-a9e2adb02bbc","resolution":{"observed_at":"2026-08-12T15:58:00.404078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.381476Z","title":"The price of debiasing automatic metrics in natural language evalaution,","venue":null,"work_id":"7987db02-a316-4850-8ab7-08e57119aa23","year":2018},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.086657Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:ee63f65d9d4aeff7c38ccbdade8d8cd047a398ba9f5ea948eda0a39c2204a915","observation_id":"36f26620-a2c8-4401-97bc-bd21a8460b2e","resolution":{"observed_at":"2026-08-12T15:58:00.387011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.361589Z","title":"Results of the WMT19 metrics shared task: Segment-level and strong MT systems pose big challenges,","venue":null,"work_id":"98798702-51c1-4b1b-b21d-2b2ea1167a10","year":2019},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.091795Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:608e0f344edf1bc6208dbeaedbfcb28dc6a01f851a33c5a8b9e505a6a9edaf3c","observation_id":"a529aaaa-5a33-48ed-aa01-d5f2195f0b05","resolution":{"observed_at":"2026-08-12T15:58:00.367418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.321447Z","title":"BLEURT: Learning robust metrics for text generation,","venue":null,"work_id":"62cfab5e-1264-425b-a0cf-2c5303e13c97","year":2020},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.102593Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:2c3ebb894ab5c71fc6f73a1bdaef8fadf4e468874f149c25b5f1498fa554f01f","observation_id":"e541fbc6-452f-4ca9-91c9-d3589c0e7d54","resolution":{"observed_at":"2026-08-12T15:58:00.327588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.304702Z","title":"Experts, errors, and context: A large- scale study of human evaluation for machine translation,","venue":null,"work_id":"c49f177c-2586-40b6-b9e6-394c7e93f375","year":2021},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.107173Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:ec687e3bef69644551e8d4e3d8380b570c5ddc6735191c1e63da3fc21ffad7b0","observation_id":"e0fc2071-05aa-4c97-8976-220791929180","resolution":{"observed_at":"2026-08-12T15:58:00.309794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05986","last_updated":"2020-11-05T14:46:45Z","snapshot_observed_at":"2026-08-15T13:01:59.880479Z","submitted_at":"2020-04-13T15:02:29Z","title":"CLUE: A Chinese Language Understanding Evaluation Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05986","snapshot_observed_at":"2026-08-12T15:57:59.112412Z","title":"Clue: A chinese language understanding evaluation benchmark,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.112412Z"},"links":{"cited_paper":"/paper/2004.05986","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:3b314e12cf4052c30811aa6ef1a695746e75cfd6673aea0166bc0b59e803afe3","observation_id":"052a4e68-7256-4c08-a965-1578c85b7550","resolution":{"observed_at":"2026-08-12T15:57:59.112412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.157745Z","title":"Benchmarking llms via uncertainty quantification,","venue":null,"work_id":"f488f191-d9d6-4a89-a8fe-c453f16296a3","year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.117860Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:68b3d9da148b5be178c7e6d7f1fcef4a7415d4bbecf313c8654313b85ca4c700","observation_id":"7f49f40d-d55d-4dbf-afc5-3cf55ccf8a29","resolution":{"observed_at":"2026-08-12T15:58:00.162940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.125050Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.125050Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:2d4646a4404e66d31b227f29274b0c44a6bf2f99a61d8590ba4389be1dfcbfa0","observation_id":"47059008-98e6-42f5-b91d-5d7d1585a89c","resolution":{"observed_at":"2026-08-12T15:57:59.125050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.129844Z","title":"Revisiting out-of-distribution robust- ness in nlp: Benchmark, analysis, and llms evaluations,","venue":null,"work_id":"245f8016-7356-4734-bb57-3e101548c5dd","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.131265Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:6903d9f357657b373ff3c9b102f0b1f57c51b31d847e4456b6962744fabfaf54","observation_id":"b3e33ce1-657a-4438-9c61-dd64e4ca600f","resolution":{"observed_at":"2026-08-12T15:58:00.135736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.139603Z","title":"Is chatgpt a good translator? yes with gpt-4 as the engine,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.139603Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:17eedfb04b082498999fd343f9d367e61b003fb616a78fdf0589377e801bf112","observation_id":"ceef260e-c2a2-4512-9b37-a834514b8025","resolution":{"observed_at":"2026-08-12T15:57:59.139603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10542","last_updated":"2024-05-17T05:03:40Z","snapshot_observed_at":"2026-08-16T13:51:58.780513Z","submitted_at":"2024-05-17T05:03:40Z","title":"Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10542","snapshot_observed_at":"2026-08-12T15:57:59.145357Z","title":"Benchmarking large language models on cflue–a chinese financial language understanding evaluation dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.145357Z"},"links":{"cited_paper":"/paper/2405.10542","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:df7d68164a0a9b214eeb2a9da1b3794d33943571b8ea62767d3636e99c4a4954","observation_id":"d4979cb6-76c4-4fed-a6aa-8192173d70ea","resolution":{"observed_at":"2026-08-12T15:57:59.145357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.150231Z","title":"Evaluating large language models for radiology natural language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.150231Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:37b839d6a88b7f0dda9b63001cb98e683e1aa86b18415fbad68aab4b9da233ef","observation_id":"11b321c1-7735-4960-a90c-2d2cd927fb7d","resolution":{"observed_at":"2026-08-12T15:57:59.150231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12356","last_updated":"2023-05-23T22:52:18Z","snapshot_observed_at":"2026-08-16T16:29:59.187175Z","submitted_at":"2022-09-26T01:04:52Z","title":"News Summarization and Evaluation in the Era of GPT-3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.12356","snapshot_observed_at":"2026-08-12T15:57:59.155212Z","title":"News summarization and evaluation in the era of gpt-3,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.155212Z"},"links":{"cited_paper":"/paper/2209.12356","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:ee7bfd57b4565efd15fa63522290ca61b18627e2d70024a6c0ca9acf6d8aa666","observation_id":"ccdd6389-30e5-4080-8e1b-4334600d34f8","resolution":{"observed_at":"2026-08-12T15:57:59.155212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.102289Z","title":"Using gpt-4 to provide tiered, formative code feedback,","venue":null,"work_id":"8ebba6a0-fec8-4c0c-8390-51d7a69894de","year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.160248Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:42cccf56e6f49be426f85dc7aae90dcbcea06fa4c45bcbcef1e20fb02d61a786","observation_id":"99907c1f-f5f4-40a4-88da-88d13fbc5820","resolution":{"observed_at":"2026-08-12T15:58:00.107347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.085647Z","title":"A comparison of human and gpt-4 use of probabilistic phrases in a coordination game,","venue":null,"work_id":"c3cc7ee2-e34f-470a-840a-fd61bfe22b73","year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.165898Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:5cfc2e7b0a347610d2654d9081585e64b532cc131f059bd69482195963583048","observation_id":"6675944a-8299-45c5-a0c1-173f2a8ab9be","resolution":{"observed_at":"2026-08-12T15:58:00.091070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.064524Z","title":"Chatgpt and gpt-4 for professional translators: Exploring the potential of large language models in translation,","venue":null,"work_id":"3a07ad8d-106b-48fc-a03f-7959fe2d54f3","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.172079Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:2b2553f39f0f242bd514bdfdd7cd0ffaa768a79327bf6956a50a7a3e0db88b3b","observation_id":"09016438-5a3e-4ff5-994e-e6e3a58b9bf9","resolution":{"observed_at":"2026-08-12T15:58:00.071481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09545","last_updated":"2025-08-24T21:13:02Z","snapshot_observed_at":"2026-08-16T14:34:32.218061Z","submitted_at":"2023-12-15T05:40:15Z","title":"Does GPT-4 surpass human performance in linguistic pragmatics?","version":2},"cited_work":{"arxiv_id":"2312.09545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.09545","snapshot_observed_at":"2026-08-12T15:57:59.505526Z","title":"Does GPT-4 surpass human performance in linguistic pragmatics?","venue":"cs.CL","work_id":"50b92eed-375e-43b1-b7e8-1dd7c82dc7b6","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.177099Z"},"links":{"cited_paper":"/paper/2312.09545","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:e18f5407b003c6af3c2244bffe7d8093a883576bee05cb23034ce8cc68bd1fd4","observation_id":"f9a77c46-8bc0-4462-828e-8a16b304319f","resolution":{"observed_at":"2026-08-12T15:57:59.511027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.038754Z","title":"Comparative analysis of gpt-4vision, gpt-4 and open source llms in clinical diag- nostic accuracy: A benchmark against human expertise,","venue":null,"work_id":"46285940-b397-4271-8cbd-e2ba03a8aaf2","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.182876Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:a2eef95aa760ac28633f31f7202823079adb8a93ef95d260928b5a126dacbbc8","observation_id":"0b1fa082-81c4-4d5a-b0c8-ce7b3fdf81fc","resolution":{"observed_at":"2026-08-12T15:58:00.047439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.013785Z","title":"Continuous measurement scales in human evaluation of machine translation,","venue":null,"work_id":"01a6966c-6b47-49a6-aa86-61b4044c4ca3","year":2013},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.187765Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:ac6b4642b3793b91243995b9adc09c6394d730fed01cbe7323c8794bedc89b21","observation_id":"b7e5562b-f896-46f4-a1e3-6f78f68b3fc9","resolution":{"observed_at":"2026-08-12T15:58:00.023366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.993079Z","title":"Findings of the 2021 conference on machine translation (wmt21),","venue":null,"work_id":"149bd591-c7e6-4f19-a838-54bfab036496","year":2021},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.193129Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:9c07d76617a737abd89c80d43939fa7fe9652a6b34e7bb193ba92aea679615ec","observation_id":"4612f68a-b83f-43df-96f6-7e48143c47cc","resolution":{"observed_at":"2026-08-12T15:57:59.998572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.976110Z","title":"Findings of the 2022 conference on machine translation (wmt22),","venue":null,"work_id":"a7d0c0fb-353a-4f69-b531-387a19d6240f","year":2022},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.197791Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:7ebf431656616754902a0e8856038b1fc90a2e7cd5233cdb786562f349b9d9ad","observation_id":"55aec91a-71f0-4c61-afd5-9525fa23d7d3","resolution":{"observed_at":"2026-08-12T15:57:59.981751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.958787Z","title":"Findings of the 2023 conference on machine translation (wmt23): Llms are here but not quite there yet,","venue":null,"work_id":"98cd4a45-bcbd-4228-8d06-ed0d89ac50c0","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.203542Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:d0860fb7ba37e860e608f74986baef2ffd00b7a0add7eff12cc81a1938706c6b","observation_id":"3866e6d7-c00c-423e-9089-7539a6e75933","resolution":{"observed_at":"2026-08-12T15:57:59.963860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.942782Z","title":"Assessing inter-annotator agreement for translation error annotation,","venue":null,"work_id":"37e3f7be-241f-41ff-a60d-112d59df5f48","year":2014},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.208256Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:140e4ca0a2bf1bc4755a209be90b4e7d1d9c3c742db0125c60d6886000156ad5","observation_id":"815e74eb-38f0-45d2-8199-15bda42cf4cd","resolution":{"observed_at":"2026-08-12T15:57:59.947859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.926784Z","title":"Quantitative fine-grained human evaluation of machine translation systems: a case study on english to croatian,","venue":null,"work_id":"3308e884-5296-450b-8fe8-55140f645d51","year":2018},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.212977Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:d727b72eade633baf33a3309f8f1c5765074e40f195de6b65b843a519e046deb","observation_id":"796d7dd5-0dc0-47d1-ad58-eb0afc309510","resolution":{"observed_at":"2026-08-12T15:57:59.932115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:58:00.339650Z","title":"COMET: A neural framework for MT evaluation,","venue":null,"work_id":"9a8d947d-d4b8-4ab1-ad42-8c97abe461a3","year":2020},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.217974Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:680b9d7d39f1dd05af1aedca1e90ebd09d4c42711e237e15568c874623f0580f","observation_id":"25f529b7-f594-427c-a936-a7512d97cad7","resolution":{"observed_at":"2026-08-12T15:58:00.345427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.910360Z","title":"Results of WMT22 metrics shared task: Stop using BLEU – neural metrics are better and more robust,","venue":null,"work_id":"0ea7d09c-d267-4c97-bf3e-d4384e583503","year":2022},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.222913Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:f8bc8b942f9dfbc65eca9a46e4e869eb090f67a55f8eccae7bbfb88374b3b902","observation_id":"c8e05a55-ca3c-4249-88c7-e45e900b1e0e","resolution":{"observed_at":"2026-08-12T15:57:59.915721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.894093Z","title":"Results of WMT23 metrics shared task: Metrics might be guilty but references are not innocent,","venue":null,"work_id":"5df6b922-c388-47d5-8854-9597917d736b","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.228477Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:3bf848ebb6473f2e85f0d2ae3006df0769179247135e2a76efe12004f9e326d2","observation_id":"ca1b0cb6-503b-402e-a1cb-f2a5db47431c","resolution":{"observed_at":"2026-08-12T15:57:59.898699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05567","last_updated":"2018-06-29T19:16:39Z","snapshot_observed_at":"2026-08-14T19:36:00.860774Z","submitted_at":"2018-03-15T01:30:58Z","title":"Achieving Human Parity on Automatic Chinese to English News Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05567","snapshot_observed_at":"2026-08-12T15:57:59.233007Z","title":"Achieving human parity on automatic chinese to english news translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.233007Z"},"links":{"cited_paper":"/paper/1803.05567","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:4a6eb710e4cdb1856c90eb5347aabfb62f473fea20474a3c99bd8ba051c77f7b","observation_id":"2b1ab9cf-1439-4de9-b7e5-6037483a0aa7","resolution":{"observed_at":"2026-08-12T15:57:59.233007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.877460Z","title":"aubli, “What’s the difference between professional human and machine translation? a blind multi-language study on domain-specific MT,","venue":null,"work_id":"c6a369f2-3a0c-407b-9da5-e6f712d9ac59","year":2020},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.238211Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:e578375f95ef6970ab2ec7d8e89655696502b0cce82bb01b2e5766e9b7aa504c","observation_id":"b39280d5-49d4-4aa1-873c-0b83a13ff5f4","resolution":{"observed_at":"2026-08-12T15:57:59.883055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.861810Z","title":"Attaining the unattainable? reassessing claims of human parity in neural machine translation,","venue":null,"work_id":"14a6cc55-b23d-4ad9-875d-a915bb239ac4","year":2018},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.243424Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:b3a344f334e288dc4baa60b786c0231b8306b707ccc70df31bd8738f70ad5260","observation_id":"82db6a20-27ee-4c56-bab4-4bebadfa6ee3","resolution":{"observed_at":"2026-08-12T15:57:59.866785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2110.0199","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.462530Z","title":"The suboptimal wmt test sets and its impact on human 12 parity,","venue":null,"work_id":"24d2e2c3-652d-41ae-8603-848f75070407","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.248907Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:68398a5687ca14ef3f3bb0c033da0c8c0ddffa28528f882932adc0bcc2b01aa6","observation_id":"7e3fd4bb-7fc1-4298-a0ec-e95af82c0bea","resolution":{"observed_at":"2026-08-12T15:57:59.472395Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.846006Z","title":"On\" human parity","venue":null,"work_id":"7718b01a-91eb-4fd3-bfc0-fd8e75340df4","year":2022},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.253359Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:e8b5493f38a9270c5d763e15093158c8ef9a069b171817d617c396ad692d98ae","observation_id":"76b702ca-ae6b-47da-9c1d-6f2725f1e02b","resolution":{"observed_at":"2026-08-12T15:57:59.851342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.830131Z","title":"Assessing human-parity in machine translation on the segment level,","venue":null,"work_id":"4ac9c765-be62-4004-801f-2538d6039811","year":2020},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.257760Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:4c37a92783bec986ed68e157dc762764a750774a8ca2d0947367d0cd4ccc3dbf","observation_id":"34d3d709-df9e-465d-9e95-1f426ae8fd33","resolution":{"observed_at":"2026-08-12T15:57:59.835335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-16T15:06:35.991757Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-12T15:57:59.262609Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.262609Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:a4de511025be8b09ce2687aa9ce3dc8dc00f707e7faa34fde65d1c059012f117","observation_id":"39592dcf-237c-44b2-b543-72f49a0aed08","resolution":{"observed_at":"2026-08-12T15:57:59.262609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.267659Z","title":"Calibrate before use: Improving few-shot performance of language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.267659Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:befaaefac6921ade4a7a098ad47fdf83e75b4573c33da7686513aa3a302e4a00","observation_id":"6b340e10-fbc3-401c-ac2e-0901e82f103c","resolution":{"observed_at":"2026-08-12T15:57:59.267659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.803176Z","title":"Pre-train, prompt, and predict: A systematic survey of prompting methods in natural language processing,","venue":null,"work_id":"04644722-f9d6-4a96-a0dc-968ed21f9ad9","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.272793Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:55aaf653427cdc3a000fe90ca0e89a4be633874cf5ff83a397b82d9a802181fb","observation_id":"73d907f9-783f-4a66-bd08-7cf2a060edad","resolution":{"observed_at":"2026-08-12T15:57:59.808512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.786874Z","title":"A paradigm shift in machine translation: Boosting translation performance of large language models,","venue":null,"work_id":"73aadc9d-b3fb-40e9-bae5-08c4e81a7368","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.279195Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:e84dda07a08ae43a313227e4b289ca9661d03acbea5738b53e24e56c9099c513","observation_id":"f883a8c5-8272-489e-800f-53b8809e77db","resolution":{"observed_at":"2026-08-12T15:57:59.792365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.770675Z","title":"Comet: A neural framework for mt evaluation,","venue":null,"work_id":"db9d3552-40f7-4d2a-8d44-1f62aca1749e","year":2020},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.284784Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:915e566c3d4a60008f1a0bab059150d684fed9cf3683bb8270a1af29a57cee74","observation_id":"e9b5c8e7-679d-4625-b7e4-300baf8296ee","resolution":{"observed_at":"2026-08-12T15:57:59.775722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.754748Z","title":"doccano: Text annotation tool for human,","venue":null,"work_id":"68c0bd0f-cebf-4db6-948d-c3421a936a62","year":2018},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.291396Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:171575e0bd1e912d5c18dd8b5097b778335e31e9de13f234f900042f3ddd572c","observation_id":"fbe27486-29a6-4d6b-9499-dbdc126b2d23","resolution":{"observed_at":"2026-08-12T15:57:59.759733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.296481Z","title":"A coefficient of agreement for nominal scales,","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.296481Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:42a9ae5d285e9185917f752ee6508f9f2f9e4df966d4f7af97a6bd7ea9f22278","observation_id":"e367a4c2-752a-4c2b-bd0e-c341c8d8d00f","resolution":{"observed_at":"2026-08-12T15:57:59.296481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.727726Z","title":"Validity in content analysis,","venue":null,"work_id":"1a446f92-f02a-4ca2-bcf0-238e584c3929","year":1980},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.301131Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:b2ce5687859f7933448325cea57409158e76c345ebb8b0c2bfa2192cb7edda68","observation_id":"53ce2c5b-636f-40f0-92f0-98f26bd75074","resolution":{"observed_at":"2026-08-12T15:57:59.733467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:57:59.711440Z","title":"Not all countries celebrate thanksgiving: On the cultural dominance in large language models,","venue":null,"work_id":"9794c56e-aee2-4499-9978-845657e69dca","year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.306255Z"},"links":{"citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:bec0b484980b159c7f76d61c98055249d7af415988b4483f42d6715df9b7508f","observation_id":"05f34536-60c7-496e-90dd-73795c35a7ea","resolution":{"observed_at":"2026-08-12T15:57:59.716804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-08-16T12:38:46.158503Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-12T15:57:59.311066Z","title":"Siren’s song in the ai ocean: a survey on hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.311066Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:f7b7deb4a20d0b62aad17ae101f230e443f464cf9112501d79c32c07b66e5691","observation_id":"23c12a05-1e9e-4938-8d03-15ae2f193816","resolution":{"observed_at":"2026-08-12T15:57:59.311066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16379","last_updated":"2024-06-21T07:35:53Z","snapshot_observed_at":"2026-08-16T14:15:24.534227Z","submitted_at":"2024-02-26T07:58:12Z","title":"TEaR: Improving LLM-based Machine Translation with Systematic Self-Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16379","snapshot_observed_at":"2026-08-12T15:57:59.316216Z","title":"Tear: Improving llm-based machine translation with systematic self- refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.316216Z"},"links":{"cited_paper":"/paper/2402.16379","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:c8b9b68cccef596b6c4a65b6925203ec7e28a4eb48eccb719b70ad9038dccd6a","observation_id":"4edbe24d-32fc-4c82-9288-930eef5be2e2","resolution":{"observed_at":"2026-08-12T15:57:59.316216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11804","last_updated":"2025-05-01T12:02:02Z","snapshot_observed_at":"2026-08-16T13:51:25.484223Z","submitted_at":"2024-05-20T05:55:08Z","title":"(Perhaps) Beyond Human Translation: Harnessing Multi-Agent Collaboration for Translating Ultra-Long Literary Texts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11804","snapshot_observed_at":"2026-08-12T15:57:59.321417Z","title":"(perhaps) beyond human translation: Harnessing multi-agent collaboration for translating ultra-long literary texts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:57:59.321417Z"},"links":{"cited_paper":"/paper/2405.11804","citing_paper":"/paper/2411.13775"},"observation_digest":"sha256:b6687cd876c8846c620ef13d1945af082a95501563b64a87f6dcf98c88065464","observation_id":"83a043c7-7aea-4856-a638-746d09a6a0a8","resolution":{"observed_at":"2026-08-12T15:57:59.321417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13775","last_updated":"2024-11-21T01:12:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:50:28.549047Z","submitted_at":"2024-11-21T01:12:46Z","title":"Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2411.13775."}