{"as_of":"2026-08-14T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8443ab804f19e69ad1b55986e187e22c45bf4bb777798950826b7a53e0df563c","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:31:04.475518Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02985/citation-record","integrity":"/paper/2608.02985/integrity","json":"/paper/2608.02985/citation-record.json","paper":"/paper/2608.02985"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.345601Z","title":"Look-ahead-bench: A standardized benchmark of look-ahead bias in point-in-time LLMs for finance.arXiv preprint arXiv:2601.13770,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.345601Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:cb51cbd61e9203667e5cc738af5984515a54e82766e65f5d2898de78c4745044","observation_id":"aa84cace-faa1-4012-bd2f-d475aca4e98c","resolution":{"observed_at":"2026-08-08T04:31:04.345601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.029410Z","title":null,"venue":null,"work_id":"8001f9e9-3436-4ad2-99b5-3492cb618a50","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.450644Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:02b2880388d8eaaff4aa292c5d9f2cbf51dbaaa0e762c13fa157e1b49987f688","observation_id":"d6eff41d-17eb-4136-a1c6-7c3725515f50","resolution":{"observed_at":"2026-08-08T04:31:05.033066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.975416Z","title":null,"venue":null,"work_id":"177cdfc5-cd8f-4581-a834-5fdb5d995164","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.469239Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:27a4d5cb281b8dcbd1b40c86c893c72f465e6c951db7d8cf003af034d8b9415d","observation_id":"2578518a-f8ae-4224-b19e-e50c39d6686a","resolution":{"observed_at":"2026-08-08T04:31:04.978959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.087317Z","title":null,"venue":null,"work_id":"f3b6823f-18a7-4e88-b457-0f3cc5a3d9e4","year":1969},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.429286Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:2297793f6ede61c5a89093fc313a05dc590920504d344befea46326d7918781f","observation_id":"b21ca94e-9c29-49a0-85fc-b6201c56ca47","resolution":{"observed_at":"2026-08-08T04:31:05.090136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09247","last_updated":"2024-10-11T20:46:56Z","snapshot_observed_at":"2026-08-12T22:25:04.319838Z","submitted_at":"2024-10-11T20:46:56Z","title":"Benchmark Inflation: Revealing LLM Performance Gaps Using Retro-Holdouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09247","snapshot_observed_at":"2026-08-08T04:31:04.364840Z","title":"Benchmark inflation: Revealing LLM performance gaps using retro-holdouts.arXiv preprint arXiv:2410.09247,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.364840Z"},"links":{"cited_paper":"/paper/2410.09247","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:392b0f38727109ec24bf2d2681da95fd57a311beb6a0b48802a08f9eb03335ba","observation_id":"57e002fd-a558-4c7a-acf4-fe54ebfd2a4b","resolution":{"observed_at":"2026-08-08T04:31:04.364840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.069123Z","title":"Table 4 is the map: each theoretical claim of Sections 3 to 5 and the experiment whose headline result carries it","venue":null,"work_id":"269f0da9-619e-458f-8764-d67968b79aef","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.436187Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:52756ab83500928f3bf5ee5ec7697a0ea6aef47dd40e7d32c39dba0460bd0130","observation_id":"88949916-c22c-436b-aa7b-4bae0dce7452","resolution":{"observed_at":"2026-08-08T04:31:05.072640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24564","last_updated":"2026-05-23T12:57:18Z","snapshot_observed_at":"2026-08-12T05:36:51.796037Z","submitted_at":"2026-05-23T12:57:18Z","title":"Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.24564","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24564","snapshot_observed_at":"2026-08-08T04:31:04.775797Z","title":"Summoning the Oracle to Slay It: Mitigating Look-Ahead Bias in Financial Backtesting with Large Language Models","venue":"cs.AI","work_id":"957796e2-fade-4440-bd7f-33d3827077f1","year":2026},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.376212Z"},"links":{"cited_paper":"/paper/2605.24564","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:e89eb5a110597b863d8e1495b911a84afe74cfed9b63f515f9327c0ba5f3bada","observation_id":"62b7d53d-17d2-42c7-90eb-eefe20d0813a","resolution":{"observed_at":"2026-08-08T04:31:04.780051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19533","last_updated":"2025-05-26T05:39:57Z","snapshot_observed_at":"2026-08-08T00:00:45.680749Z","submitted_at":"2025-05-26T05:39:57Z","title":"ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.19533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19533","snapshot_observed_at":"2026-08-08T04:31:04.760758Z","title":"ExAnte: A Benchmark for Ex-Ante Inference in Large Language Models","venue":"cs.LG","work_id":"52567b85-577a-479d-be2f-fb234b1b2eac","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.379362Z"},"links":{"cited_paper":"/paper/2505.19533","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:2f0d8f2222dff22a22f32d3db0c47d80841e8da0ce91682d780d8d808d0ef92f","observation_id":"34e6a539-1707-4c8c-83d1-cb68f3072666","resolution":{"observed_at":"2026-08-08T04:31:04.765917Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17623","last_updated":"2023-11-24T01:45:16Z","snapshot_observed_at":"2026-08-13T05:39:37.986560Z","submitted_at":"2023-10-26T17:43:13Z","title":"Proving Test Set Contamination in Black Box Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17623","snapshot_observed_at":"2026-08-08T04:31:04.382539Z","title":"Daniel Paleka, Shashwat Goel, Jonas Geiping, and Florian Tramèr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.382539Z"},"links":{"cited_paper":"/paper/2310.17623","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:dd739f88e43c76cb770d8c9f858f9f2e1916414a4bb69088cf2042b19d145e4f","observation_id":"f10255f9-bef7-4875-8408-e3c823662b4e","resolution":{"observed_at":"2026-08-08T04:31:04.382539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-11T14:03:14.734044Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-08-08T04:31:04.385535Z","title":"14 Andrew J Patton and Allan Timmermann","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.385535Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:99e96b358374d33c82d63c43ce2e02e6972d509db7275829ba3d91865fe21bf3","observation_id":"7f3bb58b-25dc-4411-b7fa-83f44904762a","resolution":{"observed_at":"2026-08-08T04:31:04.385535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00699","last_updated":"2025-07-09T19:56:02Z","snapshot_observed_at":"2026-08-13T00:40:34.368813Z","submitted_at":"2024-03-31T14:32:02Z","title":"A Comprehensive Survey of Contamination Detection Methods in Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00699","snapshot_observed_at":"2026-08-08T04:31:04.388470Z","title":"Martin Riddell, Ansong Ni, and Arman Cohan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.388470Z"},"links":{"cited_paper":"/paper/2404.00699","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:c82ed7185fb3ef01af681656717596d3bebb430f5b1139b80ffaf6ddc39af116","observation_id":"c1155d93-b9f5-4885-bd2a-7d502bc2c26c","resolution":{"observed_at":"2026-08-08T04:31:04.388470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04811","last_updated":"2024-03-06T21:45:35Z","snapshot_observed_at":"2026-08-13T04:01:52.294743Z","submitted_at":"2024-03-06T21:45:35Z","title":"Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04811","snapshot_observed_at":"2026-08-08T04:31:04.391835Z","title":"Manley Roberts, Himanshu Thakur, Christine Herlihy, Colin White, and Samuel Dooley","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.391835Z"},"links":{"cited_paper":"/paper/2403.04811","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:277500029992f14ec7dfe276edcbb36a08a1b0819c508397071648449c5b738e","observation_id":"765eb102-f051-4d11-bad6-a9e8a45ace8c","resolution":{"observed_at":"2026-08-08T04:31:04.391835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.095995Z","title":"NLP evaluation in trouble: On the need to measure LLM data contamination for each benchmark","venue":null,"work_id":"7c97fed7-9e6c-46fd-b144-f06d9f74e72d","year":2023},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.395288Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:bbff59d9ada763b61e23515df65a14039d6cd799ae233b456f2721e70dd8c534","observation_id":"7d15f498-479f-4ef2-a62c-23e136f7c027","resolution":{"observed_at":"2026-08-08T04:31:05.099410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.398711Z","title":"Quantifying the effect of test set contamination on generative evaluations.arXiv preprint arXiv:2601.04301,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.398711Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:2c6e76f7975fdf38321ca86e1bae7d8e07bc2f2453a1dda411425ae4301e0400","observation_id":"853a2f93-9126-4740-8770-3eedf6e9fa71","resolution":{"observed_at":"2026-08-08T04:31:04.398711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.405329Z","title":"Colin White, Samuel Dooley, Manley Roberts, Arka Pal, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.405329Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:8c692521489fad14862a582de740901d0481dff6b9d80ed1db393527499bdf06","observation_id":"bc60c097-8936-407a-b34d-3e600514dff0","resolution":{"observed_at":"2026-08-08T04:31:04.405329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-08T04:31:04.408456Z","title":"Jeffrey M Wooldridge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.408456Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:3f0b4e673ccb4654cde76e8af4dfa26a4281e002ee33b3818d9f11901cf9e83e","observation_id":"d4342b7b-c2a5-44d1-bc7c-7682006aeb82","resolution":{"observed_at":"2026-08-08T04:31:04.408456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-08T04:31:04.411806Z","title":"Benchmark data contamination of large language models: A survey.arXiv preprint arXiv:2406.04244,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.411806Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:216c0366c62c087c3491b6f0e2799531df1971bbf9e415694493a75b2282c660","observation_id":"772e1434-6b8e-4cfa-937d-653c40d82d9d","resolution":{"observed_at":"2026-08-08T04:31:04.411806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11838","last_updated":"2026-07-23T15:24:41Z","snapshot_observed_at":"2026-08-13T14:44:20.532261Z","submitted_at":"2026-03-12T12:04:43Z","title":"DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11838","snapshot_observed_at":"2026-08-08T04:31:04.415388Z","title":"DatedGPT: Preventing lookahead bias in large language models with time-aware pretraining.arXiv preprint arXiv:2603.11838,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.415388Z"},"links":{"cited_paper":"/paper/2603.11838","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:a4fd3207ec33f4fe2fe7f0658420231add42fc34a2a2840e3a53918ce5944e30","observation_id":"b6d5b39f-7720-483f-a62c-bd18e18337aa","resolution":{"observed_at":"2026-08-08T04:31:04.415388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-13T05:29:41.829205Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-08T04:31:04.418737Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.418737Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:4b0028e9cccfccd5d640e1c8f52007d9d0ce4f1801d0f07a2274c0659cfae9db","observation_id":"372bad00-77da-4547-981f-6351c5a94418","resolution":{"observed_at":"2026-08-08T04:31:04.418737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27055","last_updated":"2026-05-12T17:08:27Z","snapshot_observed_at":"2026-07-06T22:34:33.419178Z","submitted_at":"2025-10-30T23:50:05Z","title":"Detecting Data Contamination in LLMs via In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.27055","snapshot_observed_at":"2026-08-08T04:31:04.422329Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.422329Z"},"links":{"cited_paper":"/paper/2510.27055","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:450a2769f5ba944d05823255eeb277a3df939f70ce8018274d3e58b71cec18c3","observation_id":"41e2cb85-5083-426e-b99e-3fe4ba1df6b5","resolution":{"observed_at":"2026-08-08T04:31:04.422329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-14T07:41:49.296836Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-08T04:31:04.425762Z","title":"Zeyu Zhang, Ryan Chen, and Bradly C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.425762Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:6b921d0028ac62b837d4f909e5dcb97ab12c81e64a6a8271495d5ce12d372724","observation_id":"cf2f86c7-c6f3-492d-bfa4-9deb7ac76e34","resolution":{"observed_at":"2026-08-08T04:31:04.425762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.060175Z","title":null,"venue":null,"work_id":"3776cee5-1332-4109-ae4c-91de06552921","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.439874Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:bcb1ff34771c08726287c061cba618126b39a1f9e41bc81b14085da18f3d1422","observation_id":"8b6905b3-5d1a-4114-b422-92d06516544b","resolution":{"observed_at":"2026-08-08T04:31:05.063406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.049937Z","title":null,"venue":null,"work_id":"75e733aa-219c-4f59-be1e-727f73fa4f63","year":2026},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.443472Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:3ad79d6b07018c1d5c079514a870d22fc9b0c8ba62ad6326b1fb1353be07df02","observation_id":"db180450-b928-4133-9961-150004c49a3a","resolution":{"observed_at":"2026-08-08T04:31:05.053534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.039551Z","title":null,"venue":null,"work_id":"52b7ea57-c5a5-41d5-b8a1-76ed4a482bb2","year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.447050Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:8cf1bea46c3b10a1d6e2e91e1e40a02f80482230796e77aadbb40b0fbb863b08","observation_id":"59330655-316d-4c44-b6a5-75ccfaa33fd2","resolution":{"observed_at":"2026-08-08T04:31:05.043282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.019057Z","title":"Controls are MiniMax-M3 and Claude-Opus-4.7, whose January 2026 cutoffs leave no leakage discontinuity inside the tested window","venue":null,"work_id":"7ab03062-4ff4-480d-afc4-c631baf4c119","year":2026},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.453942Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:6cc61194015b9bca4e27ebe4527a9bc0bcd2ba6402720b9f712ce3ca56cac778","observation_id":"38c1209c-35c2-409b-8cae-1b0c3fa5eb29","resolution":{"observed_at":"2026-08-08T04:31:05.022778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.997066Z","title":"Eachproblemcarriesitscontest release date, so a model can only have trained on a problem’s solution if the contest occurred before the model’s training cutoff","venue":null,"work_id":"355d0c99-67e3-4d2a-86df-328e87c8fb52","year":2023},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.461264Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:ee570077b159ac35ed9f36f138fdd6d1f081c5d89147d5e99143caea8cca94a8","observation_id":"e5bd1bdb-b5eb-4a63-841f-2cd158db3496","resolution":{"observed_at":"2026-08-08T04:31:05.000807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.964775Z","title":"paraphrases","venue":null,"work_id":"f8696eb0-bfae-40cf-bb4b-73eda8923c3b","year":2000},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.472308Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:a03b249bd190192fa3ce386a599af1b7091f8fa680ab2616c098a307ad1ac7d9","observation_id":"9e29a8fe-3126-4a30-9921-726385db38a5","resolution":{"observed_at":"2026-08-08T04:31:04.968317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.952137Z","title":"Treatment–control PRC excess by domain and pooled, under Platt and isotonic calibration","venue":null,"work_id":"331c1aa0-127b-4525-b571-8545faaaccea","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.475518Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:a4535c6607d234b36edcdf151d9b81869d3ea63989dab5de7cfc7579d106f4a9","observation_id":"1686ff19-2009-461f-a0d6-df65bd193856","resolution":{"observed_at":"2026-08-08T04:31:04.955926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.007847Z","title":"Because the leakage estimand is ajumprather than a level, protocol level effects cancel unless they vary sharply in time","venue":null,"work_id":"a5c2ec15-0257-4135-9375-a97cbf36c566","year":2025},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":910,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.457610Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:19c26bb1cd9397bffca273f6add2b8807e34c04849c713d31ec6b80fe87071d3","observation_id":"e8e041c5-3ade-46a3-b70c-5f8d4a85de48","resolution":{"observed_at":"2026-08-08T04:31:05.011782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21206","last_updated":"2025-07-06T01:02:58Z","snapshot_observed_at":"2026-08-09T06:21:53.504098Z","submitted_at":"2025-02-28T16:25:50Z","title":"Chronologically Consistent Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21206","snapshot_observed_at":"2026-08-08T04:31:04.368666Z","title":"Chronologically consistent large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.368666Z"},"links":{"cited_paper":"/paper/2502.21206","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:7e47e2e57ae6621975ae359babfc55e613b86bd448a26b462600c5edd3a26369","observation_id":"65fe6454-1ca9-49f2-83ea-6f93f1670b22","resolution":{"observed_at":"2026-08-08T04:31:04.368666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.361204Z","title":"Detecting lookahead bias in LLM forecasts.arXiv preprint arXiv:2512.23847,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":1987,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.361204Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:71b740ebec3f7cea6929e3df60d4b7fca4b816b0d6dfc686eab41f4bf0a6c3ba","observation_id":"c79b8ee5-2332-4943-a681-58e9ec2b1c02","resolution":{"observed_at":"2026-08-08T04:31:04.361204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.078297Z","title":"The sharp-bounds framing of Theorem 2 follows partial identification (Manski, 2003; Imbens & Manski, 2004)","venue":null,"work_id":"f2b8c5ac-a3f7-4d7f-b847-554a139deca4","year":2015},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.432684Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:4fae7e3a03902c61b128fd2f8e30fcd9ed4fe69df4d8eae673084624116326e5","observation_id":"5faa8654-e29e-4563-88e5-c5054eb22f46","resolution":{"observed_at":"2026-08-08T04:31:05.081622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-12T22:06:29.305370Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-08-08T04:31:04.401902Z","title":"Singh, Muhammed Yusuf Kocyigit, Andrew Poulton, David Esiobu, Maria Lomeli, Gergely Szilvasy, and Dieuwke Hupkes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.401902Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:228b459e9ea832a5121b221c1b1f860e0a7e4f260594b5761ed641ebdd1d415d","observation_id":"c0328c06-8a03-4415-88fd-e754b03f040c","resolution":{"observed_at":"2026-08-08T04:31:04.401902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.105356Z","title":"Time machine GPT","venue":null,"work_id":"388387dd-b677-42a9-a1b4-d151f487cd63","year":2024},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.353655Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:c61a547965041102c5ba42c164e614f83ba6d970a56d018b28f50e0a3339d6bb","observation_id":"a0004f2f-ec5b-48d7-ae3c-becedf7c2733","resolution":{"observed_at":"2026-08-08T04:31:05.108653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:04.985895Z","title":"Composition controls have cutoffsafterthe latest problem (Gemini-2.5-Pro, DeepSeek-R1, and the published 2025-cutoff pool)","venue":null,"work_id":"8cc3daa2-324b-438f-8b62-2da20c9eb099","year":2026},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.465422Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:4bcb0d384f78d8e807130f1e3e0295a63a85741f1325315de9a544efcbbb2f3c","observation_id":"5028d306-cf6b-4a91-acca-f6e123629764","resolution":{"observed_at":"2026-08-08T04:31:04.990275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07841","last_updated":"2024-09-16T13:18:23Z","snapshot_observed_at":"2026-08-13T04:20:24.398988Z","submitted_at":"2024-02-12T17:52:05Z","title":"Do Membership Inference Attacks Work on Large Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07841","snapshot_observed_at":"2026-08-08T04:31:04.357384Z","title":"Graham Elliott and Allan Timmermann.Economic Forecasting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.357384Z"},"links":{"cited_paper":"/paper/2402.07841","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:8a4ea660c3554d8228ab5dbb7dd9f13f0520b465b2979e196bc5fe0228a5ce78","observation_id":"3b6506ba-f4ae-43db-9bd6-7e0531d18027","resolution":{"observed_at":"2026-08-08T04:31:04.357384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-08T04:31:04.372400Z","title":"Minhao Jiang, Ken Ziyu Liu, Ming Zhong, Rylan Schaeffer, Siru Ouyang, Jiawei Han, and Sanmi Koyejo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.372400Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:5d338d19f67f6423de7bfe3e6dce74c37e8489bcceaeba7a9b96c7ac019da932","observation_id":"8ba30b76-3c39-4208-82c9-d9ee8bfc293e","resolution":{"observed_at":"2026-08-08T04:31:04.372400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:31:05.115126Z","title":"Language models are few-shot learners","venue":null,"work_id":"81c0a065-7e72-487a-a181-60248a4d06b3","year":1901},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.349752Z"},"links":{"citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:1019287d41ddd59fe68c077b537a82b1dcf0b9fa38cd3c8711d77847d3d1f5b4","observation_id":"f3c8b989-f5b5-40e6-8984-7503679df9e1","resolution":{"observed_at":"2026-08-08T04:31:05.118711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T11:50:26.104345Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2608.02985."}