{"as_of":"2026-08-10T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9de2ab627d77d75a22b489d41bb3e4077be06fd812f6ac69fff9ae1cb811da80","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:03:13.238164Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:31:04.385535Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.596036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-08-06T14:22:31.301050Z","title":"Pitfalls in evaluating language model forecasters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19477","last_updated":"2025-07-25T17:59:13Z","snapshot_observed_at":"2026-08-09T00:54:32.599309Z","submitted_at":"2025-07-25T17:59:13Z","title":"Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:22:31.301050Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2507.19477"},"observation_digest":"sha256:ddecf1d4542febadc17aabdc54fe904fc0a0d0d1006433e12d0d41ffb4c3c6fc","observation_id":"ea63d7ae-fdf2-44c3-a6f4-daf17c074fd1","resolution":{"observed_at":"2026-08-06T14:22:31.301050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2604.18576","last_updated":"2026-07-12T18:34:47Z","snapshot_observed_at":"2026-07-16T23:18:42.403825Z","submitted_at":"2026-04-20T17:57:51Z","title":"Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T04:14:17.395227Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2604.18576"},"observation_digest":"sha256:10493591d7870326bb326e749d2ee8ad640aea5aca4d68364b8f99fb2416aa5d","observation_id":"dc9bdf19-a263-4c7d-ace7-a5a1d7382167","resolution":{"observed_at":"2026-05-11T12:06:01.790093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-14T19:33:20.775008Z","title":"Pitfalls in evaluating language model forecasters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.18576","last_updated":"2026-07-12T18:34:47Z","snapshot_observed_at":"2026-07-16T23:18:42.403825Z","submitted_at":"2026-04-20T17:57:51Z","title":"Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T19:33:20.775008Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2604.18576"},"observation_digest":"sha256:d9f29e2edbc632f75ba0aaf614751a517e0a5ffd537b14e27a0f6586edbbde0e","observation_id":"d7b565c1-5342-4cde-8ccc-302464aeda7e","resolution":{"observed_at":"2026-07-14T19:33:20.775008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2605.03762","last_updated":"2026-05-05T13:50:50Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T13:50:50Z","title":"OracleProto: A Reproducible Framework for Benchmarking LLM Native Forecasting via Knowledge Cutoff and Temporal Masking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:29:51.187292Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2605.03762"},"observation_digest":"sha256:0918b4ef252b39ffac717f12b8dbd9f6fd94e7e1d2b7fae7b9aa4f861b7254cb","observation_id":"4fddfe23-5ead-4288-9c8b-e0e9468a9566","resolution":{"observed_at":"2026-05-11T23:41:16.852549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2605.22672","last_updated":"2026-05-22T17:57:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:33Z","title":"Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-22T05:24:10.513564Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2605.22672"},"observation_digest":"sha256:a6eba11ffd65bd5c717563fcef373d5dcc3ebc4cea41a5c5c9726444816b1882","observation_id":"581b2b62-0eb3-4eb6-8def-1f9932c4e0ac","resolution":{"observed_at":"2026-05-22T05:24:38.182496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2605.22672","last_updated":"2026-05-22T17:57:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:33Z","title":"Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-25T06:04:28.277835Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2605.22672"},"observation_digest":"sha256:581e5958605ec7a739da8994938c569c67245213d803c270263aa312a4e3509e","observation_id":"1308da45-df6a-4fa8-9541-48f021f3391b","resolution":{"observed_at":"2026-05-25T06:05:26.173990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2607.00164","last_updated":"2026-06-30T20:42:45Z","snapshot_observed_at":"2026-08-04T14:45:57.113312Z","submitted_at":"2026-06-30T20:42:45Z","title":"Verifiable Rewards for Calibrated Probabilistic Forecasting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T19:45:23.721172Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2607.00164"},"observation_digest":"sha256:548b9202737c57b11f8da91d039af7438b93dad9534583c06342fe0be93e6c82","observation_id":"96a2d95c-533a-408f-a97b-695b4234adc6","resolution":{"observed_at":"2026-07-02T19:47:18.746566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2607.01661","last_updated":"2026-07-02T03:41:25Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T03:41:25Z","title":"Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-03T14:40:49.038578Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2607.01661"},"observation_digest":"sha256:da525b3e12c3ce888a23dc7a61e1084e8525cb6abbbef1736c400d44063ba206","observation_id":"f722227c-1417-4514-a413-5aff1b4cdb29","resolution":{"observed_at":"2026-07-03T14:48:32.597385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-14T14:36:29.370385Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09921","last_updated":"2026-07-10T19:16:03Z","snapshot_observed_at":"2026-08-10T03:36:35.275642Z","submitted_at":"2026-07-10T19:16:03Z","title":"Global Merger-Arbitrage Forecasting with Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T14:36:29.370385Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2607.09921"},"observation_digest":"sha256:9808fcceaf81bd29ce5c0ca47ec03cda27a9bb1e8b9478c25e13af4ceb0d9ef8","observation_id":"7af55740-3045-4809-8594-c92e94661666","resolution":{"observed_at":"2026-07-14T14:36:29.370385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-08-08T04:31:04.385535Z","title":"14 Andrew J Patton and Allan Timmermann","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-09T03:46:38.259856Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.385535Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:3ff4d2b2173fc90b25cee91243facb1df89c8ac25b788ffb4a20aa796e4b392b","observation_id":"7f3bb58b-25dc-4411-b7fa-83f44904762a","resolution":{"observed_at":"2026-08-08T04:31:04.385535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00723/citation-record","integrity":"/paper/2506.00723/integrity","json":"/paper/2506.00723/citation-record.json","paper":"/paper/2506.00723"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.554671Z","title":"Who predicted 2022?, 2023","venue":null,"work_id":"21939ff1-ffce-46b3-a1ca-b1d90f693814","year":2022},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.622895Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:2a970bc30187352205f540533bbe11dab61ff137435887eaad3a56deed38fdff","observation_id":"be73dd28-81e0-42a8-8dc8-e01252230a94","resolution":{"observed_at":"2026-08-07T12:03:17.610428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.424248Z","title":"A backtesting protocol in the era of machine learning","venue":null,"work_id":"65403674-84e0-45c0-a4e5-7bb92ea51d10","year":2018},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.696705Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:ad01d4d09afb0c59ee9f6defd6cf34b02869689932ce9578e3ece0619034b980","observation_id":"15730f2b-f060-411c-b62f-2c89ace57b7b","resolution":{"observed_at":"2026-08-07T12:03:17.485240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.297517Z","title":"The probability of backtest overfitting","venue":null,"work_id":"89338270-e691-4da1-b366-0257b61228f6","year":2015},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.739151Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:2c12cfd16d70f89d76c1d2f60e1fafa97f7a518f35793c2904ff33cecb730ac7","observation_id":"ce37d9e5-8aa5-4eec-9649-fe766e973ef4","resolution":{"observed_at":"2026-08-07T12:03:17.360878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.160319Z","title":"Contra papers claiming superhuman AI forecasting, 2024","venue":null,"work_id":"d29f94a6-66b6-4800-80eb-6d7d471a53f8","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.846511Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:3810ddb0c91b2a6a50cf68873dd44ba9bfacf26af6d872ffea52b9c53b84b232","observation_id":"c33d3321-55c5-4d0e-8c73-437e02d93db8","resolution":{"observed_at":"2026-08-07T12:03:17.233335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.015580Z","title":"Long-horizon predictability: a cautionary tale","venue":null,"work_id":"109143ff-7788-4490-85fb-5209a2b60a09","year":2019},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.927181Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:b2f8503ccd0af45dd4a255966f803c8e3bffd32240a506c7901a7819f4df0c23","observation_id":"de7a0767-3adf-40c2-a02e-3b53253eb1c4","resolution":{"observed_at":"2026-08-07T12:03:17.071504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.863238Z","title":"AI forecasting bots incoming: comment section, 2024","venue":null,"work_id":"7a325743-7189-4833-bb56-cb839a448a20","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.989448Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:14ac3f4e9a29518da3ccafd4efce864000fa8a70d701023210e0f429baa0440d","observation_id":"4c3f244a-ed12-4e92-89a0-e1d1596abd4e","resolution":{"observed_at":"2026-08-07T12:03:16.940861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.739191Z","title":"Point-in-time vs","venue":null,"work_id":"c51d307f-e74e-4b9e-ac3a-8555d488856a","year":2015},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.026963Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:377515045ed864312e4eb37fb8f534b9ca50d9fb35677f8b91ceca104e9261d9","observation_id":"037507d0-6e59-480a-8909-10b6c301879e","resolution":{"observed_at":"2026-08-07T12:03:16.780192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08324","last_updated":"2025-07-08T15:08:52Z","snapshot_observed_at":"2026-07-06T19:49:30.260410Z","submitted_at":"2024-11-13T04:20:20Z","title":"Are LLMs Prescient? A Continuous Evaluation using Daily News as the Oracle","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08324","snapshot_observed_at":"2026-08-07T12:03:10.072436Z","title":"Are LLMs prescient? A continuous evaluation using daily news as the oracle","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.072436Z"},"links":{"cited_paper":"/paper/2411.08324","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:bf12d21b865f6897d33f69b7a8ffbe7c5117c4a3f99ec38432d947eb2ab5d239","observation_id":"81d3b48b-6987-454d-a686-529767dd38d6","resolution":{"observed_at":"2026-08-07T12:03:10.072436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.630753Z","title":"Polymarket settles a market incorrectly -- again, 2024","venue":null,"work_id":"485eb053-be7d-4166-aa74-ee11f69f2845","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.160852Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:ba6f968ee28251f74fbe8dd9294fa7dca2346ffa9848b34ee779e28be5661677","observation_id":"1034a219-7dc6-4945-bbc2-7064498400e2","resolution":{"observed_at":"2026-08-07T12:03:16.689678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.482298Z","title":"Survivorship bias and mutual fund performance","venue":null,"work_id":"110e02c8-a9ae-44d2-8696-247fbc41c9ac","year":1996},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.248562Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:149b9fde882ed1d062d0feaf60f1e310cec7643614e4fdb18402df69ec252900","observation_id":"084f463d-3204-4746-9242-a9438e42eb8c","resolution":{"observed_at":"2026-08-07T12:03:16.564852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"status/1833295","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:13.683926Z","title":"Knowledge cutoff issues of GPT -4o regarding Phan et al","venue":null,"work_id":"01f43a34-edfd-49bf-be7c-aa675050ea41","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.321182Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:97a1b32d6620c6ce27b273691d67fbaef9e6dabd91e7e52b28c6bf12a35d2e75","observation_id":"93bbe428-7ea9-49c9-9544-5ce20d872745","resolution":{"observed_at":"2026-08-07T12:03:13.757585Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.349668Z","title":"Approaching human-level forecasting with language models, 2024","venue":null,"work_id":"ab986720-31b1-4fb4-bd1a-6d92c7309443","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.355084Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:cc55d7b4204cdffa25b15381628424a8ef397ddc0f0cc12041861d7a301bf0ff","observation_id":"1c467d53-bd57-4b8a-9770-f932f675f4ec","resolution":{"observed_at":"2026-08-07T12:03:16.416133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.139940Z","title":"Introducing the SalemCSPi forecasting tournament, 2022","venue":null,"work_id":"2b3386de-e9be-4ca4-90ce-42aa78033e16","year":2022},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.431995Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:6a90e1b6447856c0b02308a893af8afe711ccef504ef8d6c16c3f0fb16829de4","observation_id":"2f2fb106-dc43-41f6-b143-ff665d282ee4","resolution":{"observed_at":"2026-08-07T12:03:16.267368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:10.531282Z","title":"The emerging science of machine learning benchmarks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.531282Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:323146b726511b3faa23a02ccfc941edcc4073fe6c849a779fd9e837cd75bc7e","observation_id":"10b7605b-328b-414b-bfb2-c073521dcc7b","resolution":{"observed_at":"2026-08-07T12:03:10.531282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12036","last_updated":"2024-10-31T23:08:03Z","snapshot_observed_at":"2026-07-06T19:04:18.161175Z","submitted_at":"2024-08-21T23:42:06Z","title":"Reasoning and Tools for Human-Level Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12036","snapshot_observed_at":"2026-08-07T12:03:10.604051Z","title":"Reasoning and tools for human-level forecasting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.604051Z"},"links":{"cited_paper":"/paper/2408.12036","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:fea1ed82eb090d7008f26d21d488fe3fbc32328cab2a819c6cd3129133592c33","observation_id":"4206fdb4-2ab0-45c9-8bfb-4752d2fa8abb","resolution":{"observed_at":"2026-08-07T12:03:10.604051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.908829Z","title":"asgeirtj/system\\_prompts\\_leaks/claude.txt, 2025","venue":null,"work_id":"fed373a1-029a-4358-8d40-79b3d9291983","year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.709829Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:ceb3f7fad57e01826dfc86d546db50b4aa8ef05ba7ca031c1d3acd50fd4875d9","observation_id":"a23e1240-1b11-4fd8-b1a1-b396f8969ca0","resolution":{"observed_at":"2026-08-07T12:03:16.056698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19839","last_updated":"2025-02-28T12:35:34Z","snapshot_observed_at":"2026-07-06T19:24:12.811792Z","submitted_at":"2024-09-30T00:41:51Z","title":"ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19839","snapshot_observed_at":"2026-08-07T12:03:10.828930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.828930Z"},"links":{"cited_paper":"/paper/2409.19839","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:5c90618687eddd9d29ecf4cd2ec7241115151aba9d47d17385002986dc336319","observation_id":"4261ec35-ba33-4678-b329-acfc6b24422d","resolution":{"observed_at":"2026-08-07T12:03:10.828930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.569055Z","title":null,"venue":null,"work_id":"5e1e9032-6208-4ad0-95b2-f842eaea0dbb","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.987478Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:6c7fd4e2a387ec60c38d714527eb133daa560b96cffbbba28d9faf5895df1802","observation_id":"3af1629b-f9e9-4d1c-893f-d1f57703d2f4","resolution":{"observed_at":"2026-08-07T12:03:15.733151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12220","last_updated":"2024-10-30T12:14:35Z","snapshot_observed_at":"2026-08-07T19:54:01.229017Z","submitted_at":"2024-07-17T00:06:30Z","title":"Questionable practices in machine learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12220","snapshot_observed_at":"2026-08-07T12:03:11.167415Z","title":"Questionable practices in machine learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.167415Z"},"links":{"cited_paper":"/paper/2407.12220","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:093740cce2fef4b478079b3f314693159b04354bc661fa6b1781fb2dec798b83","observation_id":"c3a89c4a-108d-4a58-a55e-a451665968ab","resolution":{"observed_at":"2026-08-07T12:03:11.167415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.340049Z","title":"Acx2025 tournament, 2025","venue":null,"work_id":"908386ff-72e1-4d22-9dbb-1ba6a564301d","year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.289628Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:32c9c676067064f4d95e0b0546160ae6c5d4f02c8e7d0eb2e72619d10fcf075c","observation_id":"e4337b8f-8b2c-44c6-b27f-7d7c9406e5ab","resolution":{"observed_at":"2026-08-07T12:03:15.449049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18544","last_updated":"2025-01-10T01:06:06Z","snapshot_observed_at":"2026-08-03T21:07:56.054263Z","submitted_at":"2024-12-24T16:51:35Z","title":"Consistency Checks for Language Model Forecasters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18544","snapshot_observed_at":"2026-08-07T12:03:11.460739Z","title":"Consistency checks for language model forecasters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.460739Z"},"links":{"cited_paper":"/paper/2412.18544","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:13730267508529d4ac7d1cb5f8ca6e6dc95e8bfb1a678c80f2f955c77e5b0e89","observation_id":"f1dd5fa7-feed-4d11-8c08-b93fb932308d","resolution":{"observed_at":"2026-08-07T12:03:11.460739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.235612Z","title":"LLMs are superhuman forecasters, 2024","venue":null,"work_id":"1f1e6853-a1ba-400e-809e-edb44ac040df","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.576117Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:dbacef894a8b82ce08ed4ba67dd7aad9b30ffa464878bd211be9bb61b32a919a","observation_id":"cb59e2c4-b5c7-4314-91db-9dc4371b1c52","resolution":{"observed_at":"2026-08-07T12:03:15.261662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.077829Z","title":"White House planning face-to-face meeting with Biden , Xi , 2023","venue":null,"work_id":"8d1cc609-cccc-45f3-ace3-b98f92e05bde","year":2023},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.683329Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:4803245d96c23b4b2f128dd9475ded6f7a8b84795909d4c5919ea3bbc9662a1a","observation_id":"03c3e534-b96b-4478-a828-ba15118f16e4","resolution":{"observed_at":"2026-08-07T12:03:15.152038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.867677Z","title":"Against calibration, 2023","venue":null,"work_id":"989d3b0b-bf9c-40f9-abf9-008795ac11ac","year":2023},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.840935Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:143e9ecdc8d17e07d6f40395376316aeb9e6b80762472e61bffef6afa9f48f98","observation_id":"620e4317-0d9c-4058-8413-8af487b3e1ed","resolution":{"observed_at":"2026-08-07T12:03:14.980940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.690943Z","title":"Elicitation of personal probabilities and expectations","venue":null,"work_id":"e2d5639f-5ee1-4248-a18e-aca6e52476a6","year":1971},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.012201Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:3d8bfcebc3bae15e164547519da2fa714c94484fd8b3eb39131e319db745f2c3","observation_id":"293735f7-c0f8-4e09-975c-8e979dfeb9e0","resolution":{"observed_at":"2026-08-07T12:03:14.776963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.511117Z","title":"Wisdom of the silicon crowd: LLM ensemble prediction capabilities rival human crowd accuracy","venue":null,"work_id":"1a8a20fc-816d-4595-b035-cc1c4656f16e","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.184050Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:e75e7c642545d4392d767adb200555da122752bace43615df2edfffba9ea15e3","observation_id":"bdbc0f9b-f1ae-4efe-a513-e64993ed50e7","resolution":{"observed_at":"2026-08-07T12:03:14.605476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11248","last_updated":"2023-02-03T17:29:49Z","snapshot_observed_at":"2026-08-05T12:37:11.571788Z","submitted_at":"2021-06-21T16:46:11Z","title":"Alignment Problems With Current Forecasting Platforms","version":3},"cited_work":{"arxiv_id":"2106.11248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11248","snapshot_observed_at":"2026-08-07T12:03:13.399543Z","title":"Alignment Problems With Current Forecasting Platforms","venue":"cs.GT","work_id":"7f3112d5-1a94-488a-b87e-b5aa3e2bdb2f","year":2021},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.352939Z"},"links":{"cited_paper":"/paper/2106.11248","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:02e4a86c2ef9c742121ee5bf0bef4f9ba068712806fcf4a1ba9646289e69bfb5","observation_id":"648b7389-af1c-4a8e-8eb0-89b27978a1cd","resolution":{"observed_at":"2026-08-07T12:03:13.513497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.356575Z","title":"Capital asset prices: A theory of market equilibrium under conditions of risk","venue":null,"work_id":"711917be-6bdd-488a-b6cb-e6d6a93f7ad5","year":1964},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.469848Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:f2772271115467403455caa27b11221cfbf54d662fd58802b0b82527178bf4dc","observation_id":"25dddb8a-09c6-497c-b130-65a4dcef2246","resolution":{"observed_at":"2026-08-07T12:03:14.404486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.171738Z","title":"Risk-adjusted performance of mutual funds","venue":null,"work_id":"2f0c0155-6deb-418d-b9c7-181069e3828f","year":1998},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.611811Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:2268d593ea57728723b379ed4c4f6088ea6db95d454e2890c761a8c4b0834cdc","observation_id":"74a58ae5-6806-4c10-8ac8-76e40365a06d","resolution":{"observed_at":"2026-08-07T12:03:14.286663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:12.780222Z","title":"PROPHET : An inferable future forecasting benchmark with causal intervened likelihood estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.780222Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:71d092a7ec0d7ba57742950d42cd3672bac441629c31753fbb3a69c8f4d5419d","observation_id":"b5daf215-3ab5-484f-bcd8-4303013fc21f","resolution":{"observed_at":"2026-08-07T12:03:12.780222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:12.926278Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.926278Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:17d22304ce2d5c263baedf3ef34ee6df5ea3b1ed7f7cc3bfdd476079fe7ffb50","observation_id":"5860ebad-17b9-471c-98f0-d79321ead696","resolution":{"observed_at":"2026-08-07T12:03:12.926278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.016176Z","title":"Biden , Xi talks in san francisco, 2023","venue":null,"work_id":"62871633-71fb-4301-b5b7-eece7474db72","year":2023},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.000775Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:46b8085da40ee9b0303eb0c652aef5eee8d84c523bf7ee786aaf3b06dbbd848f","observation_id":"0b6b46fc-3ac1-4d28-be7b-f2bda0e20f4c","resolution":{"observed_at":"2026-08-07T12:03:14.088043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:13.856773Z","title":"Haooowang/llm-knowledge-cutoff-dates, 2025","venue":null,"work_id":"0bc4d87d-f545-493a-967d-e2294b1d6704","year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.072803Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:cf196b95cdfe192891588c12c14b6eabd1d803d82ccfd3686b4eeadf67554084","observation_id":"45783a36-cbed-4005-8c2a-bace7637202f","resolution":{"observed_at":"2026-08-07T12:03:13.939127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-04T18:35:41.659861Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-07T12:03:13.143938Z","title":"Continual learning for large language models: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.143938Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:88b6e878af0d7e41b74cee71620c48b59f76fbb4f6e330e88907457eb774e749","observation_id":"563017a7-53f1-4f38-8427-44b697a05264","resolution":{"observed_at":"2026-08-07T12:03:13.143938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15474","last_updated":"2022-10-09T23:32:19Z","snapshot_observed_at":"2026-07-06T13:26:33.250328Z","submitted_at":"2022-06-30T17:59:14Z","title":"Forecasting Future World Events with Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15474","snapshot_observed_at":"2026-08-07T12:03:13.238164Z","title":"Forecasting future world events with neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.238164Z"},"links":{"cited_paper":"/paper/2206.15474","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:0377c6aac25ee4b8f3b185360f018e1339a180f132a623f4c42f1d7f66a865b5","observation_id":"f9828a89-a1a4-4c55-8a63-67ecea5018c4","resolution":{"observed_at":"2026-08-07T12:03:13.238164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T03:36:49.485405Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 10 inbound Pith citation observations for arXiv:2506.00723."}