{"as_of":"2026-08-19T22:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da0371247492541237737cd88f0c1487062dd3fdfcf7ec29a33174f38c343542","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:39:52.407918Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11694/citation-record","integrity":"/paper/2608.11694/integrity","json":"/paper/2608.11694/citation-record.json","paper":"/paper/2608.11694"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.062361Z","title":"American Psychologist , volume=","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.062361Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:70bccd1fbe9e227ae74e4e879ae87e23b729c04f0d5c1ab8e8cbc3f74b8f1277","observation_id":"4a0b3aa5-66dd-480f-8755-8c8ed4d79bde","resolution":{"observed_at":"2026-08-16T00:39:52.062361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.066230Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.066230Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:07e2f77caf690b3119d16cf931c9f82da33b1ad965a74629e9153a9577f7b309","observation_id":"3dd46683-4846-42e5-98c0-5c1d46a7b828","resolution":{"observed_at":"2026-08-16T00:39:52.066230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.073148Z","title":"Proceedings of the 2019 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.073148Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:c5196e431dc4a9458fee79ccc3a40ed270bf33659ac79ec6171e4e6fd8d89295","observation_id":"b9642f4d-e66c-4113-b314-f253f07d72ea","resolution":{"observed_at":"2026-08-16T00:39:52.073148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06314","last_updated":"2021-10-25T01:10:38Z","snapshot_observed_at":"2026-08-16T18:03:21.632822Z","submitted_at":"2021-08-13T16:42:25Z","title":"A Dataset for Answering Time-Sensitive Questions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06314","snapshot_observed_at":"2026-08-16T00:39:52.076592Z","title":"arXiv preprint arXiv:2108.06314 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.076592Z"},"links":{"cited_paper":"/paper/2108.06314","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:90a97e3cb5ed2868dbaf200019095b2c381a44324000f4c6b06f2cf862157e79","observation_id":"109456f6-e665-4720-9b2f-d386afaa6f09","resolution":{"observed_at":"2026-08-16T00:39:52.076592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-16T00:39:52.080134Z","title":"arXiv preprint arXiv:2211.09110 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.080134Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:6509aaa02f2e27c798544b69cc19ec3a5aae9f53d390771195c63caa83ba8372","observation_id":"24f16c8e-c5b0-4c23-aa29-5710360be67a","resolution":{"observed_at":"2026-08-16T00:39:52.080134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.083429Z","title":"Psychometrika , volume=","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.083429Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d969316621ef36271743184831ea810a55bc96afafd2829ee90c28899ad5f2fe","observation_id":"06e35ed0-ecf8-4fa0-9da9-44fa5be352f6","resolution":{"observed_at":"2026-08-16T00:39:52.083429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.087044Z","title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.087044Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:e21f066c4001d3ac842424fc7832e3b21b9c03a5369315cbd524d4e80d5fcebc","observation_id":"1c3c8517-7422-43d5-9a48-0ee24479e919","resolution":{"observed_at":"2026-08-16T00:39:52.087044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.090158Z","title":"IEEE Access , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.090158Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:b817af92c475b8e28f79eeb9daf93c20fc4f0a55b01df8ec6870d0351d2c2acd","observation_id":"ed6785fc-6d2c-49ec-b036-947f4f27296f","resolution":{"observed_at":"2026-08-16T00:39:52.090158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06705","last_updated":"2021-10-25T19:41:56Z","snapshot_observed_at":"2026-08-16T18:59:05.393570Z","submitted_at":"2020-12-12T02:36:40Z","title":"Transformed-Linear Models for Time Series Extremes","version":3},"cited_work":{"arxiv_id":"2012.06705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.06705","snapshot_observed_at":"2026-08-16T00:39:52.691349Z","title":"Transformed-Linear Models for Time Series Extremes","venue":"stat.ME","work_id":"bef6634c-75f7-484c-b953-f640e6c83c24","year":2020},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.093334Z"},"links":{"cited_paper":"/paper/2012.06705","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d4f2f3fcdbde59708baa2980483d6e5af54c0032ce0b198144acd4a3e83cc082","observation_id":"c93bfb25-5b3e-48ae-9732-18aef02ab399","resolution":{"observed_at":"2026-08-16T00:39:52.697193Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.096901Z","title":"ACM Transactions on Intelligent Systems and Technology , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.096901Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:a24a944c5ff69d849666165f5d34fe926542c3d0d265fbfc95aab469b2cb1ef2","observation_id":"5f8c32a0-f5e8-4940-9a44-6dffdd8e65f1","resolution":{"observed_at":"2026-08-16T00:39:52.096901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.100276Z","title":"Proceedings of ACL , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.100276Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:1fcf71856b5edf9c9fa866352affddb583a9c113433664c0058feeda5cdadd08","observation_id":"fb2c94a3-3d22-4283-940d-7ec4970dcae0","resolution":{"observed_at":"2026-08-16T00:39:52.100276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-08-18T00:11:55.170013Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09527","snapshot_observed_at":"2026-08-16T00:39:52.103724Z","title":"arXiv preprint arXiv:2211.09527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.103724Z"},"links":{"cited_paper":"/paper/2211.09527","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:9006d7e4b25222e50ad7ce85d60d82bcc831e21803ae2701170888b7cf68c2dc","observation_id":"7f34a779-b703-44c9-9ee9-c204200b007c","resolution":{"observed_at":"2026-08-16T00:39:52.103724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-16T00:39:52.107243Z","title":"arXiv preprint arXiv:2307.15043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.107243Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:2e470c53cf4bcce09d690b90ca88bd98dad84208362c44da54a8fac74a896c52","observation_id":"a368030c-3898-4c62-9d52-31ef4d66fad4","resolution":{"observed_at":"2026-08-16T00:39:52.107243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14739","last_updated":"2023-05-24T05:19:15Z","snapshot_observed_at":"2026-08-16T15:30:21.279449Z","submitted_at":"2023-05-24T05:19:15Z","title":"Trusting Your Evidence: Hallucinate Less with Context-aware Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14739","snapshot_observed_at":"2026-08-16T00:39:52.117507Z","title":"arXiv preprint arXiv:2305.14739 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.117507Z"},"links":{"cited_paper":"/paper/2305.14739","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:fea551739748f364f474391d07d14078c27a3b3f5606620d66d48303d43df630","observation_id":"072b0d71-7e86-4954-8c51-6d0ff14ca349","resolution":{"observed_at":"2026-08-16T00:39:52.117507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.128030Z","title":"Distill , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.128030Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:009bb8d59c058644223302ba3a67c3b2b6567f97d07d9d7eb23a205b71f8dfe0","observation_id":"f7fbf4f4-ac29-4026-be64-e95332c41bbb","resolution":{"observed_at":"2026-08-16T00:39:52.128030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:53.046334Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":"2c114790-c96c-4dd1-a731-9042cc6063cd","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.131470Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:75748db5bfe08d17397ca8dfa4126b0ee3c9da6f058ce8fea136e3791ef351bc","observation_id":"9a2fa57f-161e-4465-aaee-5312862ce30c","resolution":{"observed_at":"2026-08-16T00:39:53.050672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:53.037328Z","title":"arXiv preprint arXiv:2401.xxxxx , year=","venue":null,"work_id":"95fdf11b-9a25-4231-ad86-ea7cca6ccb50","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.135446Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:27d480fc351a9d360c17bab79ae9a588406792cccf8271ce89ab49a7e1a6d129","observation_id":"672faa8e-4a09-4dd5-89ff-6203d73766f2","resolution":{"observed_at":"2026-08-16T00:39:53.040611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16906","last_updated":"2024-06-06T06:01:41Z","snapshot_observed_at":"2026-08-16T14:15:37.584929Z","submitted_at":"2024-02-25T00:56:27Z","title":"Debug like a Human: A Large Language Model Debugger via Verifying Runtime Execution Step-by-step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16906","snapshot_observed_at":"2026-08-16T00:39:52.142234Z","title":"arXiv preprint arXiv:2402.16906 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.142234Z"},"links":{"cited_paper":"/paper/2402.16906","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:5fc52d855dcfb9f668c41d8052ae6a295699eacfc38ad72f26cd5e25ec93b6e8","observation_id":"8d6663f4-c8f0-4476-a826-29a807ccb08f","resolution":{"observed_at":"2026-08-16T00:39:52.142234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:53.028311Z","title":"arXiv preprint arXiv:2312.xxxxx , year=","venue":null,"work_id":"a6ac2c97-7244-41f5-8a40-8e37006e2461","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.146342Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:409e49fc6d1f7f73219190b267ddbe803a731cf27113b74222cd5a8bd043788e","observation_id":"cac133d0-4b3c-4ea3-9cd9-07445236a2f9","resolution":{"observed_at":"2026-08-16T00:39:53.031352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05128","snapshot_observed_at":"2026-08-16T00:39:52.149556Z","title":"arXiv preprint arXiv:2304.05128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.149556Z"},"links":{"cited_paper":"/paper/2304.05128","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:573599340c8b7c33a168481d0a48cb72e95f4bb17c950f7a976b090d90b15f7f","observation_id":"a473920b-5e73-46bc-99f0-d9ab77f7ac1d","resolution":{"observed_at":"2026-08-16T00:39:52.149556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-16T00:39:52.164587Z","title":"arXiv preprint arXiv:2404.18796 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.164587Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:6acbace8aca914642dbf5a74e43491773ac897b6c36a50a4e40bee9fd52ba29c","observation_id":"b01fae02-8e58-4b60-b5a3-ceea22c4625c","resolution":{"observed_at":"2026-08-16T00:39:52.164587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.167887Z","title":"Proceedings of ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.167887Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:fadbbb868dfdb7b90b2fd6fd0ab9b1edb4a136a66ab9c864f16769d5de9c870c","observation_id":"2d59c4a8-b4fc-40b4-b858-d269151199fd","resolution":{"observed_at":"2026-08-16T00:39:52.167887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:53.015022Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":"61268d60-5d53-472d-9c8a-f35fdf1adbfa","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.174325Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:9ab1f0271887b8b5e9a9c158c0d4f4cf6c1a33259fab8ddbab652f4bd630a139","observation_id":"c93766a7-0435-4550-b113-c690e6875793","resolution":{"observed_at":"2026-08-16T00:39:53.018148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-16T05:27:41.446467Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-16T00:39:52.177206Z","title":"arXiv preprint arXiv:2205.10625 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.177206Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:7f92046c53627f20241be07b9962b174dc2dd73dd14edb42fe4187b6a288e1dd","observation_id":"83042d05-e2c3-4d49-8890-876883ea9f6d","resolution":{"observed_at":"2026-08-16T00:39:52.177206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-08-15T17:25:43.175408Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-16T00:39:52.183790Z","title":"arXiv preprint arXiv:2210.03350 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.183790Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:4f5caf98270da9eb0ba50b742235dac01fb5b8072de2c11a0c0ceef41ddd565d","observation_id":"fe72cc17-d14f-4721-900a-fc0fabb284f0","resolution":{"observed_at":"2026-08-16T00:39:52.183790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:53.005606Z","title":"Proceedings of ICLR , year=","venue":null,"work_id":"2ae6bd1a-b11f-4f50-917c-a448ca485fc5","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.187177Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:5eeec86b3273d82743b0e0e367b30ecf559a7e58260cb88aa03c23878012aab8","observation_id":"4225dfae-6b2c-4c79-bc4e-fcd2b5abc957","resolution":{"observed_at":"2026-08-16T00:39:53.009243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.997534Z","title":"Proceedings of ICLR , year=","venue":null,"work_id":"ccb031b2-43c0-4d79-84da-59722736ca74","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.190121Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:2c7a375740e3f4c4813e62078fed4aa60aea2c10da5fb2f01df46525c6928a9c","observation_id":"820012fd-dd33-4268-abda-d175a099ce9c","resolution":{"observed_at":"2026-08-16T00:39:53.000346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-08-17T11:53:58.758448Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01910","snapshot_observed_at":"2026-08-16T00:39:52.193011Z","title":"arXiv preprint arXiv:2211.01910 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.193011Z"},"links":{"cited_paper":"/paper/2211.01910","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:c7de6e52194e0eaa159309d404a81d15aaeb1284e191c568119119b2ad33e77e","observation_id":"01b1d51f-2108-4d1d-854d-f19f74a9e283","resolution":{"observed_at":"2026-08-16T00:39:52.193011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14283","last_updated":"2023-10-23T02:34:49Z","snapshot_observed_at":"2026-08-19T03:13:59.590614Z","submitted_at":"2023-05-23T17:27:50Z","title":"Query Rewriting for Retrieval-Augmented Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14283","snapshot_observed_at":"2026-08-16T00:39:52.199842Z","title":"arXiv preprint arXiv:2305.14283 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.199842Z"},"links":{"cited_paper":"/paper/2305.14283","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d3814f76ec677b31249dba8755af077c60a5b1eaa0b14cb3ec113c18053bdbf7","observation_id":"29845126-0a0a-4e85-8fa6-4a00d45bfe51","resolution":{"observed_at":"2026-08-16T00:39:52.199842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.988725Z","title":"Proceedings of NAACL-HLT , pages=","venue":null,"work_id":"1b9a57aa-758d-4f43-8a04-8de4129be276","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.203004Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:75f8f0f13f1726fc5ff033eb39efd5889a0a43d8ea72c9713dd3f43853554441","observation_id":"a6422781-e41a-43bf-bee4-6ee22d1a9e28","resolution":{"observed_at":"2026-08-16T00:39:52.991815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.980395Z","title":"arXiv preprint arXiv:2412.xxxxx , year=","venue":null,"work_id":"bd5ea562-28fc-464e-b01e-0f248f9b0dd4","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.206705Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:970a671b799ca3cc3a395616ea559eb5e7bd1a1c9755110d6088c1e69a2cb406","observation_id":"11bd3b0f-0322-4c0e-b817-32c0a374db68","resolution":{"observed_at":"2026-08-16T00:39:52.983407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.970956Z","title":"arXiv preprint arXiv:2412.xxxxx , year=","venue":null,"work_id":"8b74a480-8400-4043-982d-ea5863cbd07a","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.212755Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:325994d1bf4065563b5f87608c9caf9d40e3bf641018bbecbb0beafaaf51c75a","observation_id":"ded91785-5ec3-42e9-bc8f-5cea2ac935cd","resolution":{"observed_at":"2026-08-16T00:39:52.974864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.961374Z","title":"arXiv preprint arXiv:2412.xxxxx , year=","venue":null,"work_id":"1eb7dc2c-7781-4148-8818-e6bba8531ebc","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.215494Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:9800db7e1083b432385bfc264ce85b44d98f9de06a1c0ceec4833d514d6484d4","observation_id":"000d0a28-e75c-464e-896e-de176bd66c77","resolution":{"observed_at":"2026-08-16T00:39:52.964651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.953136Z","title":"arXiv preprint arXiv:2405.xxxxx , year=","venue":null,"work_id":"a7a0261c-75ec-466e-a725-0a770707e0a2","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.218202Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:a6f274b8af030873d6b19cef1955bfa27263c8776d118b2533ffc7d152107e6d","observation_id":"3542f226-4608-4309-85d5-dc5b1ddf4658","resolution":{"observed_at":"2026-08-16T00:39:52.956264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.943511Z","title":"2024 , note=","venue":null,"work_id":"91ccfb36-0a0c-45e4-be9f-98bf2b92fc68","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.221408Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:0526b2a61c2fdc66f98c87ea5548dd4322ff9f73fd6df45169b26320abf4087b","observation_id":"8d6eea9f-4b1e-4593-a1ab-58dab6b12eda","resolution":{"observed_at":"2026-08-16T00:39:52.946965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.934504Z","title":"2024 , note=","venue":null,"work_id":"14c6ef11-30e5-4b51-9805-3d35ae734fb6","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.224466Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:612ca12f4d32c2c5854f0f39eccf0ada0e2141595ae841c055916fc2732f7e4e","observation_id":"cd6ceb40-3b06-41fe-881a-9e6245e6b39e","resolution":{"observed_at":"2026-08-16T00:39:52.937812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.925944Z","title":null,"venue":null,"work_id":"7e3f5c8a-e2c1-4f29-a15b-d3543fed4097","year":1992},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.231272Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:5bf236b1e6e811e6c5f8f25a7f074297ab57aa0ae86b2b22de94da734ba542fc","observation_id":"57438c98-649d-487b-b6e7-142945df7d2d","resolution":{"observed_at":"2026-08-16T00:39:52.928962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.916243Z","title":null,"venue":null,"work_id":"423d0a21-38c1-43f9-afff-5a8a6a1dbacc","year":1993},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.234450Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d72689236ef69984912a8bedbf6ef6ef216c1ea232ea7edb07b0624cea7a9eb2","observation_id":"7d29956f-a067-4240-8eca-c66d90f06a0d","resolution":{"observed_at":"2026-08-16T00:39:52.919566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.906791Z","title":null,"venue":null,"work_id":"b4317e6f-747f-4353-a600-eb71b0bf9995","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.237614Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:972e7276785609f8b1d824c59f523f7b38ca262e020d427b3f049ccc6dfae399","observation_id":"e0aa3ae6-2b91-4268-b819-c223936dd16c","resolution":{"observed_at":"2026-08-16T00:39:52.910724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.896918Z","title":null,"venue":null,"work_id":"1fe6743c-0558-49df-b808-8a0fd9dc50bf","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.240583Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:7a471f422c0c73a9562f7b615c8498f7e67e7555a7e699e9cc4f1b8035319a68","observation_id":"cd38b232-9403-4df0-bb7b-ba0920572adb","resolution":{"observed_at":"2026-08-16T00:39:52.900886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.888301Z","title":null,"venue":null,"work_id":"49b82d32-b20b-4c0a-8bf5-57127dddd184","year":1989},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.243711Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:87b5eeaa52b8f2e3ce8485edecc857d1fcfe12575292f8853b2096b9bc804041","observation_id":"c6baaf8a-4275-4730-a995-b4ff038e2a11","resolution":{"observed_at":"2026-08-16T00:39:52.891221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.878435Z","title":", title =","venue":null,"work_id":"b22a24f7-00b5-4b05-ad6b-ab1fdcb23ed1","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.246745Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:cba5c077450edd71689919d7476587b54636e90496bdda5ba268824a54cfd34b","observation_id":"4f7d71ac-6318-4ab3-b766-50d9f2c849a5","resolution":{"observed_at":"2026-08-16T00:39:52.882272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.249521Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.249521Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:29d2934155fd6d64808e99aa770eaf9776e87a028200519933d6c00a8be5256a","observation_id":"b86b5a10-00a1-4759-b229-ce0607d566ea","resolution":{"observed_at":"2026-08-16T00:39:52.249521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.864815Z","title":null,"venue":null,"work_id":"c42c4c10-44e0-43dc-b9f3-682b11c1b382","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.252429Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:b6021cbad91670b696bc67a5481eb6a0db835ba778cb58df6a89af40a1715563","observation_id":"3b18db8e-9d6d-4c70-8581-153af402b92c","resolution":{"observed_at":"2026-08-16T00:39:52.867977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.856560Z","title":"2025 , eprint=","venue":null,"work_id":"533075b6-14b9-45c2-be6f-8fe485accc7d","year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.255531Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:c1a5f82c854bb6396ceeabad2837807dc08e7226b3be2754bdc6d4d8c2c0771e","observation_id":"22e85d94-484f-46fd-9483-586f0a93cb95","resolution":{"observed_at":"2026-08-16T00:39:52.859486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.259041Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.259041Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:1f4d2a26ab22b68c36155598cbe910d29518041ccb9555cd74b52fc65e2a8d7e","observation_id":"2ca7759e-e40d-4ae5-8c3a-97556c259832","resolution":{"observed_at":"2026-08-16T00:39:52.259041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.262447Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.262447Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:a0807de5e8f2ad0d07caefbc3f76ea7c3a2b053ddd8f43b7a021fc8ce5a0f693","observation_id":"8a6e6c99-5829-4ce1-9e8b-ef6f7ac7fabb","resolution":{"observed_at":"2026-08-16T00:39:52.262447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.265510Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.265510Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:c9f5e062d2d39eeda67ead4b8c73e3ddfe68a573f871b0a8bc6462b95bf580fe","observation_id":"f9c02850-0ce2-4ba5-96c2-1194fcceb87c","resolution":{"observed_at":"2026-08-16T00:39:52.265510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.268216Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.268216Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:c6aafa7b1191de27a456b3025da5ede2695f81e497d01d908a3aaca1e876435a","observation_id":"339028c1-69e8-4f57-8df2-8af0a7e2d536","resolution":{"observed_at":"2026-08-16T00:39:52.268216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.828645Z","title":"2024 , institution=","venue":null,"work_id":"e2024f01-c56e-48dd-ab90-32d32f23713b","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.271385Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:850e26f80d9ce38beb3195118af733415fa3976407302eb9e1e5aa51b5883f65","observation_id":"5b055ac8-3d62-41c1-8833-ede914938f82","resolution":{"observed_at":"2026-08-16T00:39:52.832136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.819481Z","title":"2024 , url=","venue":null,"work_id":"4b935afd-da7b-4501-a7f9-5648f6a26fe7","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.275140Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:897950a12fd98892fb9045dafe6768242f578debcd29a8698736c3213272def7","observation_id":"b17afc4a-b8b4-4f7e-aa94-6d2d817896ad","resolution":{"observed_at":"2026-08-16T00:39:52.822731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.810470Z","title":"2024 , eprint=","venue":null,"work_id":"25735aa0-f54e-4a5f-bd4f-2842e508ec4a","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.278063Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:ac79bc2f93711af52a2b9db573944dea4eaa8a63b7d2c96b9bbf7779c729068e","observation_id":"10bcb47f-3c67-414c-9560-eaa8737641ac","resolution":{"observed_at":"2026-08-16T00:39:52.813623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.280836Z","title":"2024 , eprint =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.280836Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:34d34fa59533ef44fa33206cbf08890a3579490abcb6abe8bce2ff12a86ddf4f","observation_id":"3cdcf9d4-da17-4dd1-816d-721de9e4eac1","resolution":{"observed_at":"2026-08-16T00:39:52.280836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.796377Z","title":"2021 , eprint =","venue":null,"work_id":"937bcb25-ebfd-4049-a632-331c61949fa0","year":2021},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.287941Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d6a1ceb86f6d0f4c08c725bef124ccc409222199e1a996258914bdf84ccfeb40","observation_id":"8bf043df-0fea-4a38-9cee-46ccd62e5ac3","resolution":{"observed_at":"2026-08-16T00:39:52.799689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.294509Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.294509Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:67e6e10cfff742bb50d26ab98820dcd0d7fe3d3f28177d2e9c3716b02d539149","observation_id":"a7c44720-1f06-4fb7-81a3-b3da376fb2e1","resolution":{"observed_at":"2026-08-16T00:39:52.294509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.300504Z","title":"Pragmatics in the Era of Large Language Models: A Survey on Datasets, Evaluation, Opportunities and Challenges","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.300504Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:ca83d456aa7e0c279a06df68c78970c299886c5f194f009bb1671adf75c7b6d9","observation_id":"60db8979-57cb-42be-af4a-953372c1a009","resolution":{"observed_at":"2026-08-16T00:39:52.300504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.781420Z","title":"Ant \\`o nia and Salam \\'o , Maria","venue":null,"work_id":"32007c07-cf03-4973-b0ed-1c6b2fb1777b","year":2018},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.303872Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:e261ef132027a492065690fe90e78f8766bddb73c436f806a08b30bc9f0a9c77","observation_id":"b4695234-aac8-4034-beeb-46d743bf556b","resolution":{"observed_at":"2026-08-16T00:39:52.784835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.772423Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics: Industry Track , year=","venue":null,"work_id":"8ad4ea6f-05ef-44d6-8061-2fb4121893a4","year":null},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.313141Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:230d7a67da66c65293b784c2ab83b89416afc50b6dd9a7cefdc941e1b6bff2d1","observation_id":"7fb97a12-64e1-4773-bae9-942dd1e01df9","resolution":{"observed_at":"2026-08-16T00:39:52.775938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-14T03:45:52.225630Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-16T00:39:52.316382Z","title":"Hewett, Mojan Javaheripi, Piero Kauffmann, James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.316382Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d7f4c257d1d7e9dae7b45a83c501f64c790abe74412a5648434c9ad488a4772e","observation_id":"8d3f84f2-1aa7-4dbd-b118-a019b77fed43","resolution":{"observed_at":"2026-08-16T00:39:52.316382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-16T00:39:52.319984Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.319984Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:9989f27ce6b20822909ee40e55ebcb295c142c6d23b758894a48fce08224437d","observation_id":"ff4aadb3-4b63-40cc-a4f4-78639bb99f87","resolution":{"observed_at":"2026-08-16T00:39:52.319984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-14T13:34:39.415942Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-16T00:39:52.323512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.323512Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:4a6122273b554b93fdd8b98621829459818dee7ae26070f4919af7e206ef4d29","observation_id":"9c1837ae-7470-418e-b754-f645caeeef64","resolution":{"observed_at":"2026-08-16T00:39:52.323512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T00:39:52.326186Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.326186Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:5e352820cca13fa64f102d738470027b5e7c4038471dac2549e61a02cbaff6ed","observation_id":"68549af3-e057-437b-bfa1-aaa772e8e4ae","resolution":{"observed_at":"2026-08-16T00:39:52.326186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.328984Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.328984Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:7bc9fe88d6ff6f3a8a33d941d45da2b822bba47e18abb8dcd983382249b45419","observation_id":"ca9af2cf-4364-47ce-9036-dc4974ec3244","resolution":{"observed_at":"2026-08-16T00:39:52.328984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.04840","last_updated":"2021-01-13T02:37:54Z","snapshot_observed_at":"2026-08-16T18:52:40.234455Z","submitted_at":"2021-01-13T02:37:54Z","title":"Robustness Gym: Unifying the NLP Evaluation Landscape","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.04840","snapshot_observed_at":"2026-08-16T00:39:52.331692Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.331692Z"},"links":{"cited_paper":"/paper/2101.04840","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:2adf29a5c05f9b204d334b735317e6f900d7c5339ee66ec9f54ac139fd39633b","observation_id":"bed39e8d-e445-4588-995a-f50c528c54c3","resolution":{"observed_at":"2026-08-16T00:39:52.331692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.762725Z","title":null,"venue":null,"work_id":"bf6880a6-7d5d-4c15-983a-0b11495fb591","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.334686Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:95dbe398d04008ee9bb076943651921ebdff7f25834d333f81dcd6d92585148c","observation_id":"97170ab4-e3fa-4443-a1b0-a44b2c79de52","resolution":{"observed_at":"2026-08-16T00:39:52.765947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T00:39:52.337868Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.337868Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:b800e126bb95dfb32b863e8ece4d8dd54cb256a01ff467c1772aaad74d7118ce","observation_id":"5a984a37-5c10-4b45-b82d-28347514f2a5","resolution":{"observed_at":"2026-08-16T00:39:52.337868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.753947Z","title":null,"venue":null,"work_id":"124e10e5-03b0-49a4-8fcb-6ae5a59fc902","year":2021},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.340815Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:18f9a41478993adf8bf558286dd63e6ce562453c1ef4be62de491dcb6e09d4f7","observation_id":"18949cbc-fe90-4c22-901a-1cd6c46ebb80","resolution":{"observed_at":"2026-08-16T00:39:52.757017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T00:39:52.344190Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.344190Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:5dbd57d34efbdc3e2bf09f22bea86226f3b9cc7358f3fb2bb771d904abf6b37b","observation_id":"d1f3b4a0-757d-4aca-8055-e3291e2cc6ea","resolution":{"observed_at":"2026-08-16T00:39:52.344190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-18T18:36:22.935192Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-16T00:39:52.347392Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.347392Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:a1059c477198a76e25a3fe7e4966420dc94f5e01c5af73fb90f0dd24867dda9d","observation_id":"bc503bfa-b9b5-4cc7-bf20-09f759493e69","resolution":{"observed_at":"2026-08-16T00:39:52.347392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-16T00:39:52.350464Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.350464Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:6b62d5994dd388efc0d1b44a26996c8a74168d6320ef8a384f73812965efdb5d","observation_id":"c7ff56bf-1cb0-4690-a76c-392a433eb579","resolution":{"observed_at":"2026-08-16T00:39:52.350464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02406","last_updated":"2023-04-11T19:39:17Z","snapshot_observed_at":"2026-08-15T11:54:04.569366Z","submitted_at":"2022-10-05T17:28:20Z","title":"Decomposed Prompting: A Modular Approach for Solving Complex Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02406","snapshot_observed_at":"2026-08-16T00:39:52.353992Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.353992Z"},"links":{"cited_paper":"/paper/2210.02406","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:24fec6cfccd2d7a3b3840811b70d207c4492d63304aed4b6fc02353463195e10","observation_id":"3bf73bf2-5f24-446f-9077-3cee862f65d8","resolution":{"observed_at":"2026-08-16T00:39:52.353992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-16T00:39:52.356996Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.356996Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:70287165de23b992e9da53c95ccd390a55104fb8f2c7333d98f8b41d68c2a161","observation_id":"29c3c036-d30f-4a0f-9abe-30b683d33de3","resolution":{"observed_at":"2026-08-16T00:39:52.356996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-08-17T09:48:37.358540Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-16T00:39:52.359807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.359807Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:2b911832d06a018c525db6a04483bda0b7bbf4861f0355c5379b2889d6d946ed","observation_id":"b01399e6-1792-4743-9e71-5c8ba7ac22bf","resolution":{"observed_at":"2026-08-16T00:39:52.359807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04324","last_updated":"2024-05-07T13:50:40Z","snapshot_observed_at":"2026-08-16T13:54:40.627924Z","submitted_at":"2024-05-07T13:50:40Z","title":"Granite Code Models: A Family of Open Foundation Models for Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04324","snapshot_observed_at":"2026-08-16T00:39:52.362576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.362576Z"},"links":{"cited_paper":"/paper/2405.04324","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:1e15cfb5b0400003ffc4842a325f92c24d28bbd4c1dad15f576e1acc942ea52f","observation_id":"ab384b88-11a8-432f-8c17-4315a86e9ecb","resolution":{"observed_at":"2026-08-16T00:39:52.362576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.744824Z","title":null,"venue":null,"work_id":"08735c36-d395-475c-9b51-945c91631f94","year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.366023Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:8a3b6a3f7413c3d340ce000d32aeb82a68062cf65fb7c9ade11377d5ef4d8189","observation_id":"2eb428a1-3306-46a2-bb84-3358713eac60","resolution":{"observed_at":"2026-08-16T00:39:52.747827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03495","last_updated":"2023-10-19T04:37:25Z","snapshot_observed_at":"2026-08-16T15:35:36.835145Z","submitted_at":"2023-05-04T15:15:22Z","title":"Automatic Prompt Optimization with \"Gradient Descent\" and Beam Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03495","snapshot_observed_at":"2026-08-16T00:39:52.369060Z","title":"gradient descent","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.369060Z"},"links":{"cited_paper":"/paper/2305.03495","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:fb50fc56ac6e798672b0d81176e611745bd4c938c355e11a97d39106adc4c5dd","observation_id":"71c17b2b-a50e-4d4a-9cdd-a44fb3bd3a75","resolution":{"observed_at":"2026-08-16T00:39:52.369060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.372551Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.372551Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:330b1ffbc650880693180c86b7a88adf584cea00db9f7830f8dfea91d4238c26","observation_id":"7ab81be8-bf9b-4928-af00-1c1a5236d669","resolution":{"observed_at":"2026-08-16T00:39:52.372551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.735838Z","title":null,"venue":null,"work_id":"c37e1a2b-2cb5-4f8a-b7d9-12610ac9eaf2","year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.375646Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:8d5cb4a9ee83bf1c9472cda459e7edc639a95db705bd561207967af57c1a86d8","observation_id":"c21fd6f6-b1c2-40a2-b2d3-69f9b15646be","resolution":{"observed_at":"2026-08-16T00:39:52.739113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-16T00:39:52.378889Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.378889Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:d81947ff04fd172be653ca049d534f9cf40d322a12ed5cb1f25d351a27fab267","observation_id":"8b4eefdf-1dc6-4b40-9cf9-7a367ab500e4","resolution":{"observed_at":"2026-08-16T00:39:52.378889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-17T19:15:32.679249Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-16T00:39:52.382593Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.382593Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:b843d9ebbf958da736fc3c3a291a6de0733b631ff9e7b2d6c68458d3c4e7f399","observation_id":"18b6ef97-f982-4bfd-b88a-923db5ffc3b4","resolution":{"observed_at":"2026-08-16T00:39:52.382593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T00:39:52.386246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.386246Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:5290d26339b0b1bb09023e4ec0a7ee02660c9ce3ac1860fee9ba012dba3837dc","observation_id":"f4c2d64f-7e56-40b6-b502-cf4246f02e95","resolution":{"observed_at":"2026-08-16T00:39:52.386246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04621","last_updated":"2024-06-06T06:10:00Z","snapshot_observed_at":"2026-08-19T20:10:40.832950Z","submitted_at":"2024-01-09T15:46:38Z","title":"DebugBench: Evaluating Debugging Capability of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04621","snapshot_observed_at":"2026-08-16T00:39:52.390073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.390073Z"},"links":{"cited_paper":"/paper/2401.04621","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:02b9df2aa48ee57fe37ea33c63b8fdc9011c25d778bc71e46d92f4c32a2a889f","observation_id":"4233beed-5a8d-465d-aec7-490d776d96ae","resolution":{"observed_at":"2026-08-16T00:39:52.390073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07125","last_updated":"2021-01-03T19:58:55Z","snapshot_observed_at":"2026-08-18T00:51:28.882719Z","submitted_at":"2019-08-20T01:51:40Z","title":"Universal Adversarial Triggers for Attacking and Analyzing NLP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07125","snapshot_observed_at":"2026-08-16T00:39:52.393578Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.393578Z"},"links":{"cited_paper":"/paper/1908.07125","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:50070d6ab426fcd6829a81f6ffbf30c72da0919a32f61ab62747468495d07f56","observation_id":"eabaaace-4c0d-410a-a61b-39be8a7844e7","resolution":{"observed_at":"2026-08-16T00:39:52.393578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:39:52.726657Z","title":null,"venue":null,"work_id":"ace9ab10-8424-4a80-93fd-a9589f73ed6f","year":2019},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.396361Z"},"links":{"citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:142f378d413ff5abbcc2f3516ec1599e29960fd39992b059f068db924bef19b2","observation_id":"b26d49e1-fb4e-4f5f-aea1-c3d37a80e3a5","resolution":{"observed_at":"2026-08-16T00:39:52.729732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-16T00:39:52.399322Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.399322Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:4df02cba6598ac42060a2a7a4924f36ac61da7bdebf5dcecb11606d2e5b9e519","observation_id":"3916d912-f60c-42a2-8593-599f8ac5ae9c","resolution":{"observed_at":"2026-08-16T00:39:52.399322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-16T00:39:52.402005Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.402005Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:c9ea34b458a56b60ebf0cb0620e72842b25a6ee15b8f80e8082ef2bc7c8aa4dc","observation_id":"ab7e5815-0df3-4a43-838e-6c7ab4076f46","resolution":{"observed_at":"2026-08-16T00:39:52.402005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:39:52.404876Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.404876Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:dd18ba71e0a6367956323a144d263ab2c7441226c73fac23d387502d633ad03c","observation_id":"15a16d15-6928-49d0-b0b1-7c9427d2aeb4","resolution":{"observed_at":"2026-08-16T00:39:52.404876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T00:39:52.407918Z","title":"Xing, and others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-16T00:39:52.407918Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2608.11694"},"observation_digest":"sha256:56ed2c582e4107644f0648ea2ace45fb62f4ed1614445a3ae9a563db1daeaa71","observation_id":"05d3f8d6-143b-477b-a4d8-26ab71841ca2","resolution":{"observed_at":"2026-08-16T00:39:52.407918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11694","last_updated":"2026-08-12T06:05:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T09:17:49.448595Z","submitted_at":"2026-08-12T06:05:47Z","title":"The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2608.11694."}