{"as_of":"2026-08-14T20:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2c6f338107f960aafefb2cc0051736ff0fcd47371b6658ef9dd0e80e50938bb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:07:23.253277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-12T17:07:23.253277Z","title":"Quantifying variance in evaluation benchmarks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12925","last_updated":"2024-11-19T23:23:16Z","snapshot_observed_at":"2026-08-14T09:22:00.801189Z","submitted_at":"2024-11-19T23:23:16Z","title":"Loss-to-Loss Prediction: Scaling Laws for All Datasets","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T17:07:23.253277Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2411.12925"},"observation_digest":"sha256:833ce86e8156e704bc710014285e6d7240b546732b539987003178a1059a66b9","observation_id":"8d45ccfe-0234-4aa6-855a-01ac7411d9b5","resolution":{"observed_at":"2026-08-12T17:07:23.253277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-12T15:35:58.924818Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14103","last_updated":"2024-11-21T13:09:36Z","snapshot_observed_at":"2026-08-14T09:19:57.606751Z","submitted_at":"2024-11-21T13:09:36Z","title":"Lost in Inference: Rediscovering the Role of Natural Language Inference for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T15:35:58.924818Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2411.14103"},"observation_digest":"sha256:3843cc417c4548edf618b9224ab046e661536e5bd97b690ec5a0f82416e710be","observation_id":"dbf2f91f-8564-41de-9c90-e3d558a412da","resolution":{"observed_at":"2026-08-12T15:35:58.924818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-11T21:37:27.003075Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04277","last_updated":"2024-12-05T15:59:29Z","snapshot_observed_at":"2026-08-14T09:22:00.298043Z","submitted_at":"2024-12-05T15:59:29Z","title":"Arabic Stable LM: Adapting Stable LM 2 1.6B to Arabic","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T21:37:27.003075Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2412.04277"},"observation_digest":"sha256:6d4bd78efa2fbd21359a85878dc021ce5b7751a0d203d32db3b61eadc1213370","observation_id":"5488d2ae-4920-460d-ac76-f9f5a45a5486","resolution":{"observed_at":"2026-08-11T21:37:27.003075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-11T17:34:19.733078Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08819","last_updated":"2024-12-11T23:31:06Z","snapshot_observed_at":"2026-08-13T17:56:08.097798Z","submitted_at":"2024-12-11T23:31:06Z","title":"HARP: A challenging human-annotated math reasoning benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:34:19.733078Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2412.08819"},"observation_digest":"sha256:5cdc3de33224168fc8905b0a76c142b4ee610e8a28ae8000e78365eb3aa15430","observation_id":"6cb9b301-1ad3-4483-95a2-a675fc773bc9","resolution":{"observed_at":"2026-08-11T17:34:19.733078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2502.12120","last_updated":"2026-05-20T13:58:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T18:45:25Z","title":"LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T02:47:37.492619Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2502.12120"},"observation_digest":"sha256:9c322d267638691934d497c15cf0ace455f68d42c6a2fe1f23dee06e7ff5a0f4","observation_id":"0b1e145f-0b0c-4cbf-938e-5aa28133c018","resolution":{"observed_at":"2026-05-23T02:52:27.051526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2503.17181","last_updated":"2026-04-08T09:48:41Z","snapshot_observed_at":"2026-08-12T12:42:17.628300Z","submitted_at":"2025-03-21T14:29:35Z","title":"A Study of LLMs' Preferences for Libraries and Programming Languages","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T22:53:16.951417Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2503.17181"},"observation_digest":"sha256:c283199447f22c7986b245b87b118a6006021edd1f86fd1ad4be5c0285c62d6a","observation_id":"b0ea9157-82e9-4f2d-b003-8f3f5de0b70d","resolution":{"observed_at":"2026-05-22T22:55:12.391707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T13:55:56.617692Z","title":"https://arxiv.org/abs/2406.10229","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23802","last_updated":"2025-06-02T04:19:10Z","snapshot_observed_at":"2026-08-13T19:45:57.044749Z","submitted_at":"2025-05-26T22:55:49Z","title":"MedHELM: Holistic Evaluation of Large Language Models for Medical Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.617692Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2505.23802"},"observation_digest":"sha256:d6b8321eba88ea203f850b4d00192c1e6457b562aa16cc13d312bb5c75849da0","observation_id":"bc38713e-f5ab-4a85-86d9-645a25d093ce","resolution":{"observed_at":"2026-08-07T13:55:56.617692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T12:14:23.000112Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00204","last_updated":"2025-05-30T20:19:39Z","snapshot_observed_at":"2026-08-10T18:52:15.545472Z","submitted_at":"2025-05-30T20:19:39Z","title":"Structure-Aware Fill-in-the-Middle Pretraining for Code","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:14:23.000112Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.00204"},"observation_digest":"sha256:75d230fcdb93268e39452924761b4dcecf13d6b18ecbf5bdf5734a0c558a2715","observation_id":"bef963a3-d7a2-4043-aa23-ec9d4c5e89aa","resolution":{"observed_at":"2026-08-07T12:14:23.000112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T11:18:10.760594Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03101","last_updated":"2025-06-03T17:35:56Z","snapshot_observed_at":"2026-08-14T17:18:45.404750Z","submitted_at":"2025-06-03T17:35:56Z","title":"Beyond Text Compression: Evaluating Tokenizers Across Scales","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:18:10.760594Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.03101"},"observation_digest":"sha256:4d4c56b4a7c3d41ac7e7e6bb2119735a0a9e66de57313d5d5ab910f5448f6f14","observation_id":"5238fcf6-3d49-42d7-95d7-957763d3bf49","resolution":{"observed_at":"2026-08-07T11:18:10.760594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-07T05:34:26.922228Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Oluwasanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07673","last_updated":"2026-07-21T11:15:43Z","snapshot_observed_at":"2026-08-09T03:05:20.348569Z","submitted_at":"2025-06-09T11:50:41Z","title":"How Benchmark Prediction from Fewer Data Misses the Mark","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:26.922228Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.07673"},"observation_digest":"sha256:637da8b2c3f93da8dc40af9165cb10f1e1047c1750b669ce70d9406edee3667c","observation_id":"5705a10f-9f73-4de9-ac11-01fc409cea29","resolution":{"observed_at":"2026-08-07T05:34:26.922228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-06T22:46:40.311443Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20920","last_updated":"2025-06-26T01:01:47Z","snapshot_observed_at":"2026-08-13T04:59:54.179036Z","submitted_at":"2025-06-26T01:01:47Z","title":"FineWeb2: One Pipeline to Scale Them All -- Adapting Pre-Training Data Processing to Every Language","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:40.311443Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2506.20920"},"observation_digest":"sha256:d62660b3d1a1f45eb3d62543dd033216617128372b1626a0ef5dbc4c766016fd","observation_id":"ffa8195f-6c42-430e-a18d-f5c38ae41b92","resolution":{"observed_at":"2026-08-06T22:46:40.311443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-04T17:10:43.439511Z","title":"Singh, Rylan Schaeffer, Andrew Poulton, Sanmi Koyejo, Pontus Stenetorp, Sharan Narang, and Dieuwke Hupkes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11106","last_updated":"2025-09-14T05:49:42Z","snapshot_observed_at":"2026-08-04T17:10:34.284259Z","submitted_at":"2025-09-14T05:49:42Z","title":"Fluid Language Model Benchmarking","version":1},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-04T17:10:43.439511Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2509.11106"},"observation_digest":"sha256:cabdf4f2901452a973865b20c82bae11865f10d6d32fce0f2f90c4782b8d418d","observation_id":"e2e17ed5-befc-4d79-9cb8-7275906204c8","resolution":{"observed_at":"2026-08-04T17:10:43.439511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-04T11:19:47.532043Z","title":"Quantifying variance in evaluation benchmarks, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05709","last_updated":"2026-06-04T12:15:57Z","snapshot_observed_at":"2026-08-14T19:05:18.524817Z","submitted_at":"2025-10-07T09:22:22Z","title":"Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T11:19:47.532043Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2510.05709"},"observation_digest":"sha256:4e05fae18208d20fe6ff24cc897f43c86bc50f2a87ea8d66c4d04a71b97f3427","observation_id":"5c0953d6-f1b9-4059-9f27-cdadff721879","resolution":{"observed_at":"2026-08-04T11:19:47.532043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-10T14:49:33.428173Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:5c561b406df473ca7b5af0f0ac971415954cfa7cdcdbeef41b18a5a982e46bb6","observation_id":"38ae454e-4f7b-403d-a66c-cc2cee262063","resolution":{"observed_at":"2026-05-16T16:29:14.003804Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-03T17:53:55.247281Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-10T14:49:12.058880Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T17:53:55.247281Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2512.07795"},"observation_digest":"sha256:ed725b74aad29d8ef6c87daf743c503bc2cdb8352b4d00fc1097f4a08262c7df","observation_id":"976900a8-7ad3-4a51-b8f9-ca3797e671d2","resolution":{"observed_at":"2026-08-03T17:53:55.247281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2604.23114","last_updated":"2026-04-25T02:52:33Z","snapshot_observed_at":"2026-08-11T20:46:11.784862Z","submitted_at":"2026-04-25T02:52:33Z","title":"A Tale of Two Variances: When Single-Seed Benchmarks Fail in Bayesian Deep Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T08:26:01.717280Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2604.23114"},"observation_digest":"sha256:b9835344263989c31f24bc43111b2e156da8f43074b7168f0cf3a9e13574c463","observation_id":"9f3ce2f6-22e1-4faa-a8a2-1ac5f18decc0","resolution":{"observed_at":"2026-05-11T20:36:11.793707Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2605.06213","last_updated":"2026-05-26T15:14:12Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:15:31Z","title":"Beyond Fixed Benchmarks and Worst-Case Attacks: Dynamic Boundary Evaluation for Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T10:13:35.777910Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2605.06213"},"observation_digest":"sha256:b58cb5e271e2a959ff1635b506e6b69d9070501eea01c3067f3b42858686dd80","observation_id":"507f4142-380b-435a-aab5-d0e2331614df","resolution":{"observed_at":"2026-05-11T20:06:13.592425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2605.28190","last_updated":"2026-05-27T09:11:13Z","snapshot_observed_at":"2026-08-13T03:42:08.377652Z","submitted_at":"2026-05-27T09:11:13Z","title":"The Harder Text Embedding Benchmark (HTEB): Beyond One-dimensional Static Robustness","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T12:42:53.018183Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2605.28190"},"observation_digest":"sha256:1c7ff5c916e2f8f0d25749ad2f39897e2fe58caf6c4a516f7768f204d63d86ce","observation_id":"8bbafc1c-e21b-4b90-93a7-af375f2bddfd","resolution":{"observed_at":"2026-06-29T12:43:25.039511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2605.30315","last_updated":"2026-05-28T17:54:09Z","snapshot_observed_at":"2026-08-14T09:20:35.042770Z","submitted_at":"2026-05-28T17:54:09Z","title":"Resolution Diagnostics for Paired LLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T07:15:27.402338Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2605.30315"},"observation_digest":"sha256:2b32f6f9134eefba1498e3f277651f75cbed3f58d47d97556680fb6977d1197a","observation_id":"94b16516-8599-4888-a6ea-8900097459f0","resolution":{"observed_at":"2026-06-29T07:23:13.254548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.05029","last_updated":"2026-06-03T15:57:42Z","snapshot_observed_at":"2026-08-12T16:26:29.967970Z","submitted_at":"2026-06-03T15:57:42Z","title":"Validity Threats for Foundation Model Research","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:41.653304Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.05029"},"observation_digest":"sha256:0c167c7ae8f4995fa590ceed050b9ab91978b899ea7574be47ce33955cafeff3","observation_id":"30606fe5-3738-4848-a408-cc5b42f6d912","resolution":{"observed_at":"2026-07-02T07:36:44.879438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.17426","last_updated":"2026-06-16T02:19:01Z","snapshot_observed_at":"2026-08-13T15:04:26.511353Z","submitted_at":"2026-06-16T02:19:01Z","title":"Bounded Difference Concentration for Infinitely Exchangeable Sequences with Applications to AI Benchmark Uncertainty","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T23:02:58.564465Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.17426"},"observation_digest":"sha256:cc8978ee685750ff72f2703307fb8d4bc441a715186c78713792c456a0c0ab9b","observation_id":"93cf316e-d257-42ee-b052-52a7e1bda135","resolution":{"observed_at":"2026-07-03T23:09:00.963089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:01dbb52c10b5aace55e6d67e5b8448e23f7791561e23e6dc61050577a3d28f6c","observation_id":"6d6830a2-a2fa-452e-af6b-407fe573777f","resolution":{"observed_at":"2026-07-01T15:45:47.638431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":197,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:259aac50761d7155a5acbaca81d2c9efd28c8fe57c6e76363be46c00cee8a127","observation_id":"cffd2844-7096-4c59-a7f3-1a2b2b322c4f","resolution":{"observed_at":"2026-07-02T21:17:23.993727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-07-12T02:29:58.886380Z","title":"Quantifying variance in evaluation benchmarks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03436","last_updated":"2026-07-07T05:35:41Z","snapshot_observed_at":"2026-08-13T02:54:32.190736Z","submitted_at":"2026-07-03T15:49:40Z","title":"How Much of the Routing Gap Is Real? Decomposing the Router-to-Oracle Gap into Reproducible Specialist Advantage and Single-Draw Label Noise","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T02:29:58.886380Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.03436"},"observation_digest":"sha256:64d89c7cd4476f856e4a1261d981f6821def0e4230b0786353c8ce04ed7437e2","observation_id":"7c690aa6-92c3-42d1-886a-5b6d566a38d6","resolution":{"observed_at":"2026-07-12T02:29:58.886380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":"2406.10229","doi":"10.48550/arxiv.2406.10229","metadata_source":"pith","pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":"cs.LG","work_id":"7225cb09-2ce3-40e3-9e6b-2bdbb8bc58c8","year":2024},"citing_paper":{"arxiv_id":"2607.07946","last_updated":"2026-07-08T21:45:34Z","snapshot_observed_at":"2026-08-14T19:42:44.835005Z","submitted_at":"2026-07-08T21:45:34Z","title":"DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T14:58:38.688149Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.07946"},"observation_digest":"sha256:993af5d72b721f61e39e2647fa277d5adc795e7d9df724d94cd9431e7ac0d347","observation_id":"96468dd4-d445-4fba-b111-cd7f773baf37","resolution":{"observed_at":"2026-07-10T15:07:19.640776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-02T12:17:16.303388Z","title":"org/CorpusID:270845965","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19363","last_updated":"2026-07-27T17:19:01Z","snapshot_observed_at":"2026-08-13T10:57:12.789401Z","submitted_at":"2026-06-05T05:09:15Z","title":"AdaRoPE: Not All Attention Heads Should Rotate and Scale Equally","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T12:17:16.303388Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.19363"},"observation_digest":"sha256:679286d6f122f40a7afdf3ae86e5fbec609ea14e570f0a9edfd21692d1de786e","observation_id":"daf1a889-df9e-4597-bf7c-34b3b488455c","resolution":{"observed_at":"2026-08-02T12:17:16.303388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-01T03:00:48.305722Z","title":"K., Schaeffer, R., Poulton, A., Koyejo, S., Stenetorp, P., Narang, S., and Hupkes, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25257","last_updated":"2026-07-28T03:56:23Z","snapshot_observed_at":"2026-08-14T18:49:44.015066Z","submitted_at":"2026-07-28T03:56:23Z","title":"Laplace-PSN-IRT: Uncertainty Quantification for Neural Item Response Theory Models of LLM Benchmarks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T03:00:48.305722Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.25257"},"observation_digest":"sha256:a74281742dff4836708d9e27fcbb9aac038617925a833c2cef6767a9e823f9ec","observation_id":"8c876188-bedd-4059-9116-3271153f8224","resolution":{"observed_at":"2026-08-01T03:00:48.305722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10229","snapshot_observed_at":"2026-08-01T01:16:44.479430Z","title":"arXiv preprint arXiv:2406.10229 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25891","last_updated":"2026-07-28T15:50:19Z","snapshot_observed_at":"2026-08-06T22:52:32.781663Z","submitted_at":"2026-07-28T15:50:19Z","title":"Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T01:16:44.479430Z"},"links":{"cited_paper":"/paper/2406.10229","citing_paper":"/paper/2607.25891"},"observation_digest":"sha256:d6efd191bd396536bd727daba35c63fc49b2184dc47a3e833daaf45cf10d9b1a","observation_id":"c82b8d54-7f25-4e7d-a7c0-596b29880703","resolution":{"observed_at":"2026-08-01T01:16:44.479430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.10229/citation-record","integrity":"/paper/2406.10229/integrity","json":"/paper/2406.10229/citation-record.json","paper":"/paper/2406.10229"},"outbound":[],"paper":{"arxiv_id":"2406.10229","last_updated":"2024-06-14T17:59:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T05:14:06.880238Z","submitted_at":"2024-06-14T17:59:54Z","title":"Quantifying Variance in Evaluation Benchmarks"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2406.10229."}