{"as_of":"2026-08-10T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d149be837e29aa12021d40bae97f709c30af9a8b789273dd9b85d63106ff6243","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:45:26.783659Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16259/citation-record","integrity":"/paper/2607.16259/integrity","json":"/paper/2607.16259/citation-record.json","paper":"/paper/2607.16259"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18243","last_updated":"2025-01-30T10:21:10Z","snapshot_observed_at":"2026-08-10T00:09:56.685976Z","submitted_at":"2025-01-30T10:21:10Z","title":"Statistical multi-metric evaluation and visualization of LLM system predictive performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18243","snapshot_observed_at":"2026-08-02T09:45:26.654826Z","title":"Sta- tistical multi-metric evaluation and visualization of llm system predictive performance.arXiv preprint arXiv:2501.18243,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.654826Z"},"links":{"cited_paper":"/paper/2501.18243","citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:3b87cf55889593f1dc3c7ce32b20dbe79e85015de2ce13c5c7d78dd75cfcf927","observation_id":"0ce2d397-8c5e-43ab-b500-c7fbe4be67dd","resolution":{"observed_at":"2026-08-02T09:45:26.654826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.783659Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.783659Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:ed144042842f8561dd8ae09a75c289d782b21d9dc45e794d192e0770e23d47b9","observation_id":"888ac22e-0202-40b4-9ced-e73fb5692a02","resolution":{"observed_at":"2026-08-02T09:45:26.783659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-07T10:39:44.274910Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-02T09:45:26.764175Z","title":"Adding error bars to evals: A statistical ap- proach to language model evaluations.arXiv preprint arXiv:2411.00640,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.764175Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:d64b4c2810d78bed721b4886785f6405e2b8ecef12c16546afe2052bca571e5f","observation_id":"952a4649-f56a-446f-8cf2-6448267212b1","resolution":{"observed_at":"2026-08-02T09:45:26.764175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03459","last_updated":"2023-06-21T03:03:15Z","snapshot_observed_at":"2026-08-10T20:34:08.641596Z","submitted_at":"2021-07-07T19:41:11Z","title":"Uncertainty in Ranking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03459","snapshot_observed_at":"2026-08-02T09:45:26.770767Z","title":"Uncertainty in ranking.arXiv preprint arXiv:2107.03459,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.770767Z"},"links":{"cited_paper":"/paper/2107.03459","citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:81a4f11e4efa1b51bbc1369418d81c1aa2260d05db1364e2f7304063e65ef1ef","observation_id":"d8bd6428-18df-489c-84c4-6df7bb1d22f2","resolution":{"observed_at":"2026-08-02T09:45:26.770767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.773698Z","title":"and Soares, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.773698Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:be51c6dfb23781b133eb827e7956d711366d5ebe064b99e9c5b1384f98a9d337","observation_id":"0bf3017c-bbcd-4e3f-82ee-4a1bf21a8f54","resolution":{"observed_at":"2026-08-02T09:45:26.773698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.780198Z","title":"However, the distribution may not be approximately normal, or even symmetric","venue":null,"work_id":null,"year":1945},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.780198Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:15045629d43a99090f10c7e8f8b2adb0a1f262bc400abe1f602e0c42754c6a5b","observation_id":"991caf93-f214-44a3-9db2-ca24810f52b3","resolution":{"observed_at":"2026-08-02T09:45:26.780198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.776655Z","title":"Rank CIs definitions and methods A.1","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":1945,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.776655Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:9b99d4854621805990ed34305d75fea7b30bc0cb502ad17f9f5221a0ec3fc49c","observation_id":"baf7aa5c-d312-466c-a63f-247799544128","resolution":{"observed_at":"2026-08-02T09:45:26.776655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.750418Z","title":"and Xie, M.-g","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.750418Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:bdd73a820c6c544e37ff8a6d17e3bdf995984230bee947b28af9af986e245b68","observation_id":"a7bd5273-8c29-461c-a191-deae2e3f8a1b","resolution":{"observed_at":"2026-08-02T09:45:26.750418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.756908Z","title":"Ranking the scores of algorithms with confidence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.756908Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:d476701c2b3ff3e99db0927ed9919b098d6bc77df0084e6cfe34ca2038913fe4","observation_id":"9e912ea6-43bd-4987-9d89-9cf86f6ff93a","resolution":{"observed_at":"2026-08-02T09:45:26.756908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.747218Z","title":"v067.i01","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.747218Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:47acebe3b61f6f420f4bd46edf70d28d457bf616bcdf274606c5647b08987845","observation_id":"c7959c14-d469-4ead-9123-88fc50639653","resolution":{"observed_at":"2026-08-02T09:45:26.747218Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T09:45:26.715464Z","title":"Al Mohamad, D., Goeman, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.715464Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:3e8a2f74c292fb24624167dbefb259368a3402dfa70936bde5944fedd72d1398","observation_id":"0e0ff518-4728-4b2e-91b7-ceb05ff3d2c4","resolution":{"observed_at":"2026-08-02T09:45:26.715464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04234","last_updated":"2025-01-08T02:17:34Z","snapshot_observed_at":"2026-07-06T20:17:57.863157Z","submitted_at":"2025-01-08T02:17:34Z","title":"Statistical Uncertainty Quantification for Aggregate Performance Metrics in Machine Learning Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04234","snapshot_observed_at":"2026-08-02T09:45:26.760955Z","title":"Statistical uncertainty quantification for aggregate performance met- rics in machine learning benchmarks.arXiv preprint arXiv:2501.04234,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.760955Z"},"links":{"cited_paper":"/paper/2501.04234","citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:5cfd1153e756abb79fcbc7de8ce3ccb028926f3fa028f1b5a0b362aa070cd488","observation_id":"3514908c-2504-42d2-9ea3-a515cef37245","resolution":{"observed_at":"2026-08-02T09:45:26.760955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/restud/rdad006","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1093/restud/rdad006","venue":"The Review of Economic Studies","work_id":"efb3d45d-b760-4490-84dc-8013654f19bd","year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.767692Z"},"links":{"citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:cedfc9a34e66322cebb9eafdd9587c0085c13f9e73316d5b75f6d84a9d8403df","observation_id":"42b087ab-ed08-4508-8b08-62be75a5da4b","resolution":{"observed_at":"2026-08-02T09:48:22.056526Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15205","last_updated":"2024-01-26T21:04:30Z","snapshot_observed_at":"2026-08-09T20:15:59.499627Z","submitted_at":"2024-01-26T21:04:30Z","title":"csranks: An R Package for Estimation and Inference Involving Ranks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15205","snapshot_observed_at":"2026-08-02T09:45:26.753694Z","title":"csranks: an r package for estimation and inference involving ranks.arXiv preprint arXiv:2401.15205,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:26.753694Z"},"links":{"cited_paper":"/paper/2401.15205","citing_paper":"/paper/2607.16259"},"observation_digest":"sha256:ab16fad08c44df879d768bb4f1c7fb52e51854697f909a4ade0ce087463d9ea4","observation_id":"0d68b735-f2f3-4a20-a2c0-3683e2bae536","resolution":{"observed_at":"2026-08-02T09:45:26.753694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16259","last_updated":"2026-06-28T11:19:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:56:27.384059Z","submitted_at":"2026-06-28T11:19:02Z","title":"Quantifying Ranking Uncertainty in LLM Benchmarks"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2607.16259."}