{"as_of":"2026-08-09T13:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e380f79f123ca905a516bdc7a735f6cbe10432a2b888c0b2c4a277be3a2a8309","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:45:34.619467Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:35.170514Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-07T14:44:35.170514Z","title":"Do Large Language Model Benchmarks Test Reliability?arXiv preprint arXiv:2502.03461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18102","last_updated":"2026-05-30T13:29:55Z","snapshot_observed_at":"2026-08-07T14:33:15.240605Z","submitted_at":"2025-05-23T16:57:34Z","title":"CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:35.170514Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2505.18102"},"observation_digest":"sha256:f8451ada035b6433967a7915d4861854fe9fffc411e4744ea181c6ca94b89530","observation_id":"c946dab6-15b8-4f3d-8712-c8ef1f28d4f8","resolution":{"observed_at":"2026-08-07T14:44:35.170514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2506.06414","last_updated":"2026-04-20T20:58:30Z","snapshot_observed_at":"2026-08-03T02:03:44.971897Z","submitted_at":"2025-06-06T17:33:33Z","title":"Benchmarking Misuse Mitigation Against Covert Adversaries","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T10:29:05.104520Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2506.06414"},"observation_digest":"sha256:8dd1e6a2ae8ab432524ad2948396b8e5d0c3d83de77a420a22aff27b6f4e2604","observation_id":"e91f3fcc-2d10-4a13-b825-ef4dc75f380b","resolution":{"observed_at":"2026-05-19T10:32:14.736497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-07T00:39:41.721221Z","title":"Vendrow, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12958","last_updated":"2025-06-20T15:52:06Z","snapshot_observed_at":"2026-08-07T07:24:20.034880Z","submitted_at":"2025-06-15T20:42:45Z","title":"Domain Specific Benchmarks for Evaluating Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:41.721221Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2506.12958"},"observation_digest":"sha256:b371bc3eb367ccec724b96825762cc6c7dca7b6a58a645930ae069546891f763","observation_id":"d35071e2-6a71-4045-afaa-bd7f04821575","resolution":{"observed_at":"2026-08-07T00:39:41.721221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-07T00:31:56.526077Z","title":"Do large language model benchmarks test reliability? arXiv preprint arXiv:2502.03461, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13681","last_updated":"2025-06-19T04:41:52Z","snapshot_observed_at":"2026-08-09T06:26:15.842413Z","submitted_at":"2025-06-16T16:38:04Z","title":"Min-p, Max Exaggeration: A Critical Analysis of Min-p Sampling in Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:31:56.526077Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2506.13681"},"observation_digest":"sha256:98c3326f01b0fdccf1753dc92ac3d476957cc3e015d49185d2fa2b889d3588fa","observation_id":"a71ed187-186d-4b4f-9697-0ac273e92bb4","resolution":{"observed_at":"2026-08-07T00:31:56.526077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-06T18:16:47.173923Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08924","last_updated":"2025-07-18T09:31:19Z","snapshot_observed_at":"2026-08-07T23:55:32.686302Z","submitted_at":"2025-07-11T17:56:32Z","title":"From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:16:47.173923Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2507.08924"},"observation_digest":"sha256:39167b2bb9b2a5339a382b28d53ca70ba658d1b8143ddd4e4477c76380e3a37c","observation_id":"63b7f608-d52f-4b6d-b041-f429a29b044e","resolution":{"observed_at":"2026-08-06T18:16:47.173923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:27.926646Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2507.20534"},"observation_digest":"sha256:55a39bd769858e615aa7f7b89db22ba4a734520120139c80d4dfe6517bea0db1","observation_id":"47cb0821-33b3-4e5b-8e37-95ce3a928b1a","resolution":{"observed_at":"2026-05-10T17:49:28.068240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2507.22359","last_updated":"2026-04-14T11:47:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-30T03:50:46Z","title":"League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-19T03:17:06.457421Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2507.22359"},"observation_digest":"sha256:4846fdaeacbab747203b3fd9460c07627fa1a83f1ade0c55986913d689b7df27","observation_id":"ce22e119-46ce-4751-80fc-ad0fb8f48fd7","resolution":{"observed_at":"2026-05-19T03:22:01.328205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-06T05:11:55.853126Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02208","last_updated":"2025-08-05T14:01:00Z","snapshot_observed_at":"2026-08-07T19:28:14.861679Z","submitted_at":"2025-08-04T08:59:36Z","title":"Proof2Hybrid: Automatic Mathematical Benchmark Synthesis for Proof-Centric Problems","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:55.853126Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2508.02208"},"observation_digest":"sha256:d0c0d0b90c16dfd7c7ae2d009c57b23bc9e9c93ad096eb60562ba54ee93cb589","observation_id":"f6fa3ca2-49ee-4a85-9eb3-6a48992e787d","resolution":{"observed_at":"2026-08-06T05:11:55.853126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-04T17:10:43.451638Z","title":"Do large language model benchmarks test reliability?arXiv:2502.03461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11106","last_updated":"2025-09-14T05:49:42Z","snapshot_observed_at":"2026-08-04T17:10:34.284259Z","submitted_at":"2025-09-14T05:49:42Z","title":"Fluid Language Model Benchmarking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:10:43.451638Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2509.11106"},"observation_digest":"sha256:7c5eb0f30c1dc2e044d0850d7c2598222ea6bf7848ff47082a62f9a8888c006b","observation_id":"4a505671-19a1-4e9c-bf77-740d23839d0f","resolution":{"observed_at":"2026-08-04T17:10:43.451638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2509.19590","last_updated":"2026-05-16T01:07:51Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T21:29:04Z","title":"Position: AI Evaluations Should be Grounded on a Theory of Capability","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-21T21:57:55.834632Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2509.19590"},"observation_digest":"sha256:e21fc9c6e63ee1382bf439cd9ef2df62c0e193196d468202227a9d320f31caa9","observation_id":"7a218eed-e892-43b4-8b68-880850af79c2","resolution":{"observed_at":"2026-05-21T22:00:41.470153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-04T11:38:53.608588Z","title":"Do large language model benchmarks test reliability?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04019","last_updated":"2026-07-23T05:31:21Z","snapshot_observed_at":"2026-08-07T13:06:58.891938Z","submitted_at":"2025-10-05T03:53:16Z","title":"Simple Policy Gradients for Reasoning with Diffusion Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:53.608588Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2510.04019"},"observation_digest":"sha256:4e090737dd89b00443e63ed2adf177b5f99baf91746b6a5bd8456121336ad0c1","observation_id":"e1db10e7-1e87-4e1d-9f63-3a1b455b282b","resolution":{"observed_at":"2026-08-04T11:38:53.608588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-04T08:10:10.254371Z","title":"Do large language model benchmarks test reliability?arXiv preprint arXiv:2502.03461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04689","last_updated":"2026-07-13T22:56:21Z","snapshot_observed_at":"2026-08-07T19:53:56.830038Z","submitted_at":"2025-10-26T03:54:12Z","title":"Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks","version":3},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T08:10:10.254371Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2511.04689"},"observation_digest":"sha256:5e20a7380b6c2db9704fcfe6dd6b96c1f1a7a3e2132d65f6643d644b80b1669d","observation_id":"c5e5c7af-49ef-426f-ba8a-3cc8773d3d7e","resolution":{"observed_at":"2026-08-04T08:10:10.254371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-03T02:51:56.829649Z","title":"Wang, H., Ge, S., Lipton, Z., and Xing, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09689","last_updated":"2026-06-18T12:30:19Z","snapshot_observed_at":"2026-08-06T07:48:42.751296Z","submitted_at":"2026-02-10T11:44:19Z","title":"Model soups need only one ingredient","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T02:51:56.829649Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2602.09689"},"observation_digest":"sha256:31240e084dcd8129f9ab739032246b17d21e12b9e6e3d8ab58be8a3d2f63e9fa","observation_id":"fdb3e2d9-139a-4afd-91a6-040638a7f6c1","resolution":{"observed_at":"2026-08-03T02:51:56.829649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-03T00:15:37.341267Z","title":"Do large language model benchmarks test reliability?arXiv preprint arXiv:2502.03461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11137","last_updated":"2026-05-28T23:29:40Z","snapshot_observed_at":"2026-08-03T19:24:57.288331Z","submitted_at":"2026-02-11T18:49:26Z","title":"Weight Decay Improves Language Model Plasticity","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T00:15:37.341267Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2602.11137"},"observation_digest":"sha256:387c6b0ee299af03fda4413f59219a9fec1dff377d0a7c3bac144861cfb0c950","observation_id":"ea4d81c5-9b06-4941-89d2-36dc1cf1db8f","resolution":{"observed_at":"2026-08-03T00:15:37.341267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-02T22:14:47.827344Z","title":"Tian, Y ., Li, Z., Jin, Y ., Wang, M., Wei, X., Zhao, L., Liu, Y ., Liu, J., and Liu, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.17531","last_updated":"2026-05-29T02:55:53Z","snapshot_observed_at":"2026-08-02T22:14:45.955961Z","submitted_at":"2026-02-19T16:42:46Z","title":"Position: Evaluation of ECG Representations Must Be Fixed","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:14:47.827344Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2602.17531"},"observation_digest":"sha256:3f716058f30babcb21cbf1a5da4045e5539191fa9ddcc42f1593fe617e057297","observation_id":"7b9344d9-c88c-44ae-ba95-4d3497aa72bd","resolution":{"observed_at":"2026-08-02T22:14:47.827344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2604.15726","last_updated":"2026-04-17T05:59:08Z","snapshot_observed_at":"2026-08-01T01:44:21.919940Z","submitted_at":"2026-04-17T05:59:08Z","title":"LLM Reasoning Is Latent, Not the Chain of Thought","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:05.178087Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2604.15726"},"observation_digest":"sha256:a42bb671c7d950d01f02dacdd7d2e379fa1f9e36bb5ba1ba3f5f6b58fae1c1da","observation_id":"152365d0-7c94-4818-81b7-45f60b924bed","resolution":{"observed_at":"2026-05-10T08:53:04.559520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2604.22597","last_updated":"2026-04-24T14:25:01Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:25:01Z","title":"Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T11:45:54.181019Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2604.22597"},"observation_digest":"sha256:385b14b4cf9c22539ea346ee19ed5d632dc24420a54d15cb8311e3859a557634","observation_id":"54fe561a-54e9-4d96-96ff-04e5900b9a83","resolution":{"observed_at":"2026-05-11T19:31:09.302907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2604.27405","last_updated":"2026-04-30T04:16:13Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T04:16:13Z","title":"Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T08:02:49.168872Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2604.27405"},"observation_digest":"sha256:659056310bf9b23fdfc28bcffcb68d70d751c46825929a92b227dad07f973d6b","observation_id":"24f5328d-8cc5-4a49-9c81-d91b044b41d4","resolution":{"observed_at":"2026-05-12T10:06:27.313724Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2605.02442","last_updated":"2026-05-04T10:42:26Z","snapshot_observed_at":"2026-07-30T10:52:38.632184Z","submitted_at":"2026-05-04T10:42:26Z","title":"Measuring AI Reasoning: A Guide for Researchers","version":1},"reference_index":151,"source":"arxiv_source","source_observed_at":"2026-05-08T18:53:18.586923Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2605.02442"},"observation_digest":"sha256:ce14bf2e4f38ba0cb7475b0efd853d1edb894ef394bdfb1445914b592a6fbb6b","observation_id":"e23209f5-b865-4f58-a4c2-071e5dceec73","resolution":{"observed_at":"2026-05-08T18:54:00.977963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2605.30504","last_updated":"2026-05-28T19:38:44Z","snapshot_observed_at":"2026-08-03T21:57:12.702594Z","submitted_at":"2026-05-28T19:38:44Z","title":"Auditing LLM Benchmarks with Item Response Theory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T07:32:32.771146Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2605.30504"},"observation_digest":"sha256:8d1b4b4d72e206743a94c64d9c16ee9f0c7e4c794f7cbd91cfdb711b6da0f448","observation_id":"7f005ee2-3673-4666-9e11-b68055fe34a7","resolution":{"observed_at":"2026-06-29T07:33:13.327707Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":"2502.03461","doi":"10.48550/arxiv.2502.03461","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do large language model benchmarks test reliability?","venue":"ArXiv.org","work_id":"11771fd3-b9c9-4098-a437-00e057657bb7","year":2025},"citing_paper":{"arxiv_id":"2606.11166","last_updated":"2026-06-09T17:46:10Z","snapshot_observed_at":"2026-08-07T21:17:06.825949Z","submitted_at":"2026-06-09T17:46:10Z","title":"Flaws in the LLM Automation Narrative","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T10:52:36.252919Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2606.11166"},"observation_digest":"sha256:d70a6eb4e83a4de5c331717f5b8e4c0cc3463b106cfe96723f2beb19322eb220","observation_id":"67bd4a2f-6efd-449e-87e1-4b08eed3105c","resolution":{"observed_at":"2026-07-03T08:17:45.302392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-07-13T03:06:27.991558Z","title":"Vendrow, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09424","last_updated":"2026-07-22T18:23:55Z","snapshot_observed_at":"2026-08-03T13:30:20.721621Z","submitted_at":"2026-07-10T13:51:41Z","title":"A Sovereign, Open-Source Foundation Model for German and English","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-13T03:06:27.991558Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2607.09424"},"observation_digest":"sha256:af6bd9cd056ca5afd037dcec22781a33ccf96a1f719c829e4374d51ec1550c73","observation_id":"55c2c5de-d07c-4225-835d-3ef66f2d1930","resolution":{"observed_at":"2026-07-13T03:06:27.991558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-07-14T15:13:39.458378Z","title":"Vendrow, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09424","last_updated":"2026-07-22T18:23:55Z","snapshot_observed_at":"2026-08-03T13:30:20.721621Z","submitted_at":"2026-07-10T13:51:41Z","title":"A Sovereign, Open-Source Foundation Model for German and English","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-14T15:13:39.458378Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2607.09424"},"observation_digest":"sha256:3c856ba9ace51473847be9d44a6304702e3f26e6895b2124d3fc54b94db4ce5d","observation_id":"45c50bf4-4920-4331-9b6e-eff107ac780d","resolution":{"observed_at":"2026-07-14T15:13:39.458378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-02T07:46:08.660600Z","title":"Vendrow, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09424","last_updated":"2026-07-22T18:23:55Z","snapshot_observed_at":"2026-08-03T13:30:20.721621Z","submitted_at":"2026-07-10T13:51:41Z","title":"A Sovereign, Open-Source Foundation Model for German and English","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T07:46:08.660600Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2607.09424"},"observation_digest":"sha256:171f7afc39ade9bd41a3ba26a0e1503faeb24076f50ad83049416db15287fb0c","observation_id":"45372cbc-a301-48cf-bc0d-2700a7a04f6f","resolution":{"observed_at":"2026-08-02T07:46:08.660600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-02T14:19:38.247606Z","title":"Do large language model benchmarks test reliability?arXiv preprint arXiv:2502.03461, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20440","last_updated":"2026-05-12T04:36:20Z","snapshot_observed_at":"2026-08-05T02:51:39.347998Z","submitted_at":"2026-05-12T04:36:20Z","title":"Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:19:38.247606Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2607.20440"},"observation_digest":"sha256:bad12b8a10803a04a145d8983bbf3995ae18c8293f88c5429d3b84d59001e0e9","observation_id":"6ae6023b-7bb3-4441-9584-56729f48151e","resolution":{"observed_at":"2026-08-02T14:19:38.247606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03461/citation-record","integrity":"/paper/2502.03461/integrity","json":"/paper/2502.03461/citation-record.json","paper":"/paper/2502.03461"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:45:34.905154Z","title":"Vqa: Visual question answering","venue":null,"work_id":"6cd65c53-aeba-42ae-83d0-cb2434966785","year":2015},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.567400Z"},"links":{"citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:94c1056b9e3c520bba5b8caf975045645887f7de64e12db2005743a75d7b8f70","observation_id":"1b9bfd96-d5b6-4cfa-84e2-87a3cc39c5ff","resolution":{"observed_at":"2026-08-09T04:45:34.908324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-09T04:45:34.574702Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.574702Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:1a2f67b25343a8e1267f5d9405fa954d8217b34b15017f93326b9a28ddda3f0e","observation_id":"db02c29d-d7fc-483a-a2a6-86b7ab1bb954","resolution":{"observed_at":"2026-08-09T04:45:34.574702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-09T04:45:34.586462Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.586462Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:8ecfcc4e10f61c6c1998b324c84ad105b83c5eec1a70cf67ccecd7e8f12860fb","observation_id":"82bdb3d6-3b3f-4600-ab45-79296c2a0103","resolution":{"observed_at":"2026-08-09T04:45:34.586462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"status/1831801","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:45:34.812530Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":"e22e87cf-d16c-4040-876b-0da3eaf52645","year":2023},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.591317Z"},"links":{"citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:924b0cad71b4da85d77951bba5fac74a068a9d0b1e0e83698bce7b9a200875bd","observation_id":"411b121d-201d-435c-8964-c23dd0ce06a8","resolution":{"observed_at":"2026-08-09T04:45:34.819895Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:45:34.893726Z","title":"Parsing algebraic word problems into equations","venue":null,"work_id":"98e3cdcb-d42e-448c-9c4d-597bbe55268d","year":2015},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.595213Z"},"links":{"citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:93b9c90413919abb6a4c387eb2b7492b813746ee65f34b66ee2789561da2ef9c","observation_id":"498f2953-7801-4d3f-9dec-74e579fcd234","resolution":{"observed_at":"2026-08-09T04:45:34.897607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14749","last_updated":"2021-11-07T13:04:04Z","snapshot_observed_at":"2026-08-04T22:08:50.379039Z","submitted_at":"2021-03-26T21:54:36Z","title":"Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14749","snapshot_observed_at":"2026-08-09T04:45:34.602333Z","title":"Pervasive label errors in test sets destabilize machine learning benchmarks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.602333Z"},"links":{"cited_paper":"/paper/2103.14749","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:96e9d50c1f361846ae791b621fcbc5b3e63c54b4f08c10086c5573a959190a2e","observation_id":"05fdc43a-0a68-41be-aaad-864ab2683443","resolution":{"observed_at":"2026-08-09T04:45:34.602333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:45:34.873275Z","title":"] The 15th Nepal China’s Tibet Economic and Trade Fair was held on 17-22 November 2015 in Bhrikutimandap, Kathmandu Nepal","venue":null,"work_id":"11e52a2b-883b-45d9-b943-db540bdb7f61","year":2015},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.619467Z"},"links":{"citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:8ef31cbccb2ea697023a3ff6d9c06ac3450bfea528a729ffd3812f6768871a2f","observation_id":"dcd4c2f5-c4f7-4621-8547-9e8978bb0e2c","resolution":{"observed_at":"2026-08-09T04:45:34.877030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:45:34.883638Z","title":"A Chevy for $1? Car dealer chatbots show perils of AI for customer service","venue":null,"work_id":"50357902-9356-4598-81d5-e89975284314","year":2023},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.599089Z"},"links":{"citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:f9a22558e1184dd229b496d2288c4735d54882741c6e84cc48dc71e9111b684c","observation_id":"1d55c155-c7b5-47a6-957c-ed5e752ebc3e","resolution":{"observed_at":"2026-08-09T04:45:34.887133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-09T04:45:34.610345Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.610345Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:332504c8c9b032126de268fbb73e9cbc291c5e85cf033f1e556448c8c6011453","observation_id":"763ed826-7b74-4da8-82b9-b6bbac143dc2","resolution":{"observed_at":"2026-08-09T04:45:34.610345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-07T22:43:28.600835Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-09T04:45:34.578445Z","title":"Tabfact: A large-scale dataset for table-based fact verification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.578445Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:1e8cebea431e7b2c702179fb966f3280c6054535e8489e610af2c0009c14eef6","observation_id":"68821419-7ae1-4062-a5f3-d200ee6cddf1","resolution":{"observed_at":"2026-08-09T04:45:34.578445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:45:34.582280Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.582280Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:a6580b615a00434e635c70c6bd9ab9827b13e50fa42467cfdf03975a0b8415d3","observation_id":"346a8a38-706f-490b-9a30-289f03360723","resolution":{"observed_at":"2026-08-09T04:45:34.582280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-09T04:45:34.615477Z","title":"GLUE: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.615477Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:2f388246a7d3c287fef55fdfa702e405119e4440658f06bc5419935badad11e9","observation_id":"85b513ad-882e-4c7b-b755-fb7b32d523f8","resolution":{"observed_at":"2026-08-09T04:45:34.615477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02145","last_updated":"2021-10-15T19:10:43Z","snapshot_observed_at":"2026-08-03T16:37:49.472964Z","submitted_at":"2021-04-05T20:36:11Z","title":"What Will it Take to Fix Benchmarking in Natural Language Understanding?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02145","snapshot_observed_at":"2026-08-09T04:45:34.570985Z","title":"What will it take to fix benchmarking in natural language understanding?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.570985Z"},"links":{"cited_paper":"/paper/2104.02145","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:c452d5d463eca68dfbaab97c995045ba73b6768f17c6b93c730eb758c582869c","observation_id":"5f633ecc-145a-4fa1-99df-696893cb17e7","resolution":{"observed_at":"2026-08-09T04:45:34.570985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-09T04:45:34.606271Z","title":"Are NLP models really able to solve simple math word problems?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-09T04:45:34.606271Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2502.03461"},"observation_digest":"sha256:db2a20c9df010071c05cb1ee508c4f88bfb794ff8758c239ad65e2ddcaa78832","observation_id":"4a42cf9e-0c95-4bfb-9fe4-597c8e5b6b27","resolution":{"observed_at":"2026-08-09T04:45:34.606271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:38:30.253150Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 25 inbound Pith citation observations for arXiv:2502.03461."}