{"as_of":"2026-08-24T03:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7959e64f90b1809ccfe1f6f42c79c53c11e5cb162bced60ddb4d15261e66208e","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:22:56.260694Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07762/citation-record","integrity":"/paper/2608.07762/integrity","json":"/paper/2608.07762/citation-record.json","paper":"/paper/2608.07762"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.904929Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS 2023), vol","venue":null,"work_id":"7f6de603-715a-45e3-92f4-5974baa6e745","year":2023},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.169882Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:3099dff8f46de7528c1e5b2b1de97692cf78b62333fe0a042cd902eea17b7b4c","observation_id":"cf2e32d2-3bed-4994-94ac-1a44be24183d","resolution":{"observed_at":"2026-08-11T00:22:56.908288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-15T11:17:11.258942Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-11T00:22:56.174076Z","title":"arXiv:2508.06709 (2025) https://arxiv.org/abs/2508.06709 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.174076Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:fe5e7a54fe4260d07e063d0ac805efdcd7468fdb8fb8c123823c7754161a683f","observation_id":"e166e748-13c0-4c34-b676-936972121e76","resolution":{"observed_at":"2026-08-11T00:22:56.174076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.895938Z","title":"In: Inui, K., Sakti, S., Wang, H., Wong, D.F., Bhattacharyya, P., Banerjee, B., Ekbal, A., Chakraborty, T., Singh, D.P","venue":null,"work_id":"d55ec6a9-63df-49da-b8d3-a4d3e21f8fe1","year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.178086Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:18c217b6386d6789a8d3bbfb62bec0cd947c5ebff010c5a7aa962b02c4eac13e","observation_id":"c5a99705-a1f3-4e0a-81ed-2d0a943d3177","resolution":{"observed_at":"2026-08-11T00:22:56.899434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.887040Z","title":"In: Interna- tional Conference on Learning Representations (ICLR 2026), Poster Presentation (2026)","venue":null,"work_id":"8d6f00a2-634c-4219-863b-5f34ba92a871","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.181967Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:38c93da0f98cd16eecb86c48c901b5c2dc5fc35013bb42da4bd0604ce5e9aeb8","observation_id":"458a2532-3489-4f88-9b0d-fb780f03dd6d","resolution":{"observed_at":"2026-08-11T00:22:56.890390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.186240Z","title":"arXiv:2602.08229 (2026)https://arxiv.org/abs/ 2602.08229","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.186240Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:cf56d608761994f9ac61de2c95d0412522670b73fee1f583b55a016a2ccae00f","observation_id":"37865eca-7145-4812-9758-55f1747645c4","resolution":{"observed_at":"2026-08-11T00:22:56.186240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.877558Z","title":"Accepted as a poster at ICLR 2026 (2026)","venue":null,"work_id":"370b85a3-ebc8-4ed5-8078-1c1ca6010a90","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.190328Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:bfc46cf2f409eaba85cadae8284b7abe2093854afef5aa0cf640b100c8b6b67e","observation_id":"fffea009-16b4-46cf-b6c9-cbdae67828ff","resolution":{"observed_at":"2026-08-11T00:22:56.880704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.868271Z","title":null,"venue":null,"work_id":"fde95935-a5bd-475e-b366-95ce3c61c748","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.194609Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:4ea06baf24bad573f6e9a85b1d36024d09941a9ab35e847c9fa3a4ede909769e","observation_id":"521f8251-7ece-467f-9319-4d506131640f","resolution":{"observed_at":"2026-08-11T00:22:56.871622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.858625Z","title":"In: WETSEB 2026 at ICSE 2026, Rio de Janeiro, Brazil (2026) https://conf","venue":null,"work_id":"2f3d01da-5fe0-4e65-82fb-669582813f07","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.198338Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:2381b3e003a1f809cfc20fac65d1aa1d5246030b5c387092826e9a36606a97c5","observation_id":"f2216670-4d8a-4fbc-8153-74e57fde2fa7","resolution":{"observed_at":"2026-08-11T00:22:56.862051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.201851Z","title":"Journal of Information Technology & Politics (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.201851Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:df4705efb31dddf0d9b8f195cb68a24db7efefea8a5ac4de29362bb19847a012","observation_id":"f80ee9dc-89c1-455a-a113-0dc004435781","resolution":{"observed_at":"2026-08-11T00:22:56.201851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.205427Z","title":"arXiv:2601.08785 (2026) https://arxiv.org/abs/2601","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.205427Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:25caa03c7ed15aa86f0e5ef070c697cb7742725543a0d4b6988cebe537b655b3","observation_id":"4158930c-7cc7-42cf-961c-0434245eda9f","resolution":{"observed_at":"2026-08-11T00:22:56.205427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.848492Z","title":"Stanford Graduate School of Business (2024)","venue":null,"work_id":"88e32185-8dbe-422b-b886-17fe2ccfe19d","year":2024},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.209118Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:b2966043f932597b2dcd3538b03ce02b02933f9060cc905b035ae27fea5e0633","observation_id":"7e6ca39a-d70a-43d8-8ac3-ca9fa1b3174c","resolution":{"observed_at":"2026-08-11T00:22:56.852170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.838739Z","title":"npj Artificial Intelligence 2, 7 (2026)","venue":null,"work_id":"de966dc0-9c61-444c-8877-88a95020a4eb","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.212757Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:927e0e140de62c252185cb8b2cde1c79c7e62d7b7afa9f025bdfb239bfcb5d4f","observation_id":"436d052d-5327-43e2-bd65-8feaa3b6b379","resolution":{"observed_at":"2026-08-11T00:22:56.842065Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-025-33629-9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.288391Z","title":null,"venue":null,"work_id":"dec219d9-39b4-446b-8aca-e6b0325e67e9","year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.216496Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:b51b168e4ba0c710d7885930d2af8f59fbaa0251cb26ddf420922a0fdd4bd6a8","observation_id":"1cc679d5-d34d-4917-827d-4cd15a324b19","resolution":{"observed_at":"2026-08-11T00:22:56.293730Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-11T00:38:11.18093+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-11T00:38:11.18093+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.829098Z","title":"The Guardian, Jan- uary 27 (2025)","venue":null,"work_id":"1d073c9a-6386-4aa3-8bb6-683b6b9ab16a","year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.220531Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:25b4e4f868ccb6398fe960161af9865bd08c49f225681654c34ba2fb30127fda","observation_id":"b45914c5-63e6-4b35-90ed-9f3fa130fbd7","resolution":{"observed_at":"2026-08-11T00:22:56.832811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.820102Z","title":"August 5 (2025)","venue":null,"work_id":"95f5580f-aefa-4c36-b246-0928b8366140","year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.224152Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:7546bcc7762aa5fd723d8ade6d2495c45fbba177d8807090ea7e53f3d41acae8","observation_id":"afb52df9-7fd8-4de3-87bf-5d8dd3d276ca","resolution":{"observed_at":"2026-08-11T00:22:56.823165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.810672Z","title":"May 5 (2026)","venue":null,"work_id":"dd36d572-23e2-4d65-a12c-142d939d7181","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.227723Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:0c9ebe2df35ac751ebbd7c01ca4f15d6c2f39b05dd740b23cbbe6da28a6854b0","observation_id":"65be31c7-3a11-47f3-8a76-54605581cb7a","resolution":{"observed_at":"2026-08-11T00:22:56.814371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.800125Z","title":"https://www.llama.com/docs/ model-cards-and-prompt-formats/llama3 3/","venue":null,"work_id":"fcaac51b-c442-4bc8-aa46-217ddf79407f","year":null},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.231202Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:900ae28e21b54e8457d2ee34ef2299f692eaf8abb71058f8cf5c7a894e083cd9","observation_id":"1472eddb-abb6-4c29-adfb-5e71cea46ba9","resolution":{"observed_at":"2026-08-11T00:22:56.803588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9514.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.513440Z","title":"Applied Artificial Intelligence 39, 2439610 (2025) https://www.tandfonline.com/ doi/full/10.1080/08839514.2024.2439610","venue":null,"work_id":"2d27d98e-17d1-4729-98a1-16cce3119bb1","year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.234769Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:1f1be19993413c37925aed1a84ee7549ad1778e8589a510909b553b02192c906","observation_id":"66d16501-bed2-4ed1-8937-ec5fe65a0478","resolution":{"observed_at":"2026-08-11T00:22:56.519959Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.789940Z","title":"https://finance.yahoo.com/news/ yann-lecun-meta-fudged-little-100000402.html","venue":null,"work_id":"dd884ad0-6409-4bba-922f-bcfc4a647268","year":null},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.238322Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:07206204ae352b1cb35f5ade93f27f937d9c25cfcf3307e7555fa1bf6a165e04","observation_id":"890846a9-ba39-48ba-a2f2-89c55725a734","resolution":{"observed_at":"2026-08-11T00:22:56.793570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T00:22:56.241929Z","title":"arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.241929Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:6cd859132eec3defa481634c5c88b06f83e6db75d193d766c78562b34ed17a57","observation_id":"0d6927ed-ed44-4574-ab1d-11e8a50d6eac","resolution":{"observed_at":"2026-08-11T00:22:56.241929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.779404Z","title":"Z.AI Blog (2026)","venue":null,"work_id":"dc6ea589-7abf-433b-bb28-58a94246a775","year":2026},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.245827Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:487905b0036b61af069e35d73d80a0ed7a260bea4575b49a23f4af278197297f","observation_id":"94f8e92f-6676-4a59-990d-861b48ac4b46","resolution":{"observed_at":"2026-08-11T00:22:56.783034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-11T00:22:56.249482Z","title":"arXiv:2411.04872 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.249482Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:ad70b051c95c9c3a7665b7b5f49496e9377a2047ae0156a8bb804561c01046df","observation_id":"f6019df7-8db9-45e2-83ee-2bb25c95b629","resolution":{"observed_at":"2026-08-11T00:22:56.249482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.253308Z","title":"In: Proceedings of the 2024 ACM SIGSAC Conference on Computer and Communications Security (CCS 2024), pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.253308Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:67a06e97001788e380cef68f34a3b1c162e8bd98e663dde09ca25c9cdb9e5dbe","observation_id":"6f7c5642-9d80-4550-81ba-4287d47db44a","resolution":{"observed_at":"2026-08-11T00:22:56.253308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.768924Z","title":"https://huggingface.co/collections/mistralai/ mistral-large-3","venue":null,"work_id":"7a128bc5-09ef-4898-9928-471b8d3bbc7e","year":null},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.256866Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:965596960367b7cb06646114ffd3b8bf91bed6c5b98de3807696a900dd9fede0","observation_id":"41a29074-301a-4a4d-98ee-a225d9ab67e0","resolution":{"observed_at":"2026-08-11T00:22:56.772514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:22:56.759052Z","title":null,"venue":null,"work_id":"c9215aac-7a43-4ecd-82df-15264a47a6df","year":null},"citing_paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T00:22:56.260694Z"},"links":{"citing_paper":"/paper/2608.07762"},"observation_digest":"sha256:5422b5b3075c62992494cfb0d386f49636799eb19e983c71839fc145c9b31c9b","observation_id":"aa815a6b-3d72-43eb-b797-aa3134347215","resolution":{"observed_at":"2026-08-11T00:22:56.762387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07762","last_updated":"2026-08-07T20:56:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T13:53:59.743037Z","submitted_at":"2026-08-07T20:56:21Z","title":"Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.07762."}