{"as_of":"2026-08-09T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d16479714ed60a2de8c07066b41590910a75617494c29062050d92cd75eaa4f2","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:36.904062Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06202/citation-record","integrity":"/paper/2608.06202/integrity","json":"/paper/2608.06202/citation-record.json","paper":"/paper/2608.06202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:31.564761Z","title":"2026 , note=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.564761Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:54ea4544afa84307d25057ca9456553dffb92341f0e52de4127183cd01be5f0a","observation_id":"26221a13-0976-4b7c-8ff5-babd1a283942","resolution":{"observed_at":"2026-08-07T12:44:31.564761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.932513Z","title":"Findings of the","venue":null,"work_id":"3b47edd5-0141-4e59-8410-875d0e1e734f","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.623981Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:848ab11e7fd6bcbc0af9f67f9d2f27a8783ce769b803041f686e34637d8d0f1a","observation_id":"622a2c7a-90e9-427b-bd74-9178d043a17c","resolution":{"observed_at":"2026-08-07T12:45:07.990676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.779774Z","title":"Proceedings of the 62nd","venue":null,"work_id":"13d089b4-6045-4e1d-8214-1bb513fe9aa9","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.700906Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:aff0bf74243fb1aa5ace68658720f20aa9daee1ea6e64aaaf5cf05d58e8d469f","observation_id":"462ca983-a498-4f75-b75c-16294ff53ff8","resolution":{"observed_at":"2026-08-07T12:45:07.837480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.622801Z","title":"Proceedings of the 10th SIGHAN Workshop on Chinese Language Processing (SIGHAN-10) , pages=","venue":null,"work_id":"5dca8a7c-7e1f-4adc-b711-f60402307c93","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.813047Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7084a4001c108c2419db5a0690666639c68b6ce60577f14976deebf83f7ae43f","observation_id":"dee58e1d-f0a9-4e4e-8c85-9406f8f71f35","resolution":{"observed_at":"2026-08-07T12:45:07.677459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14851","last_updated":"2025-05-09T05:26:43Z","snapshot_observed_at":"2026-07-06T20:25:49.871084Z","submitted_at":"2025-01-24T15:49:10Z","title":"JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14851","snapshot_observed_at":"2026-08-07T12:44:31.930407Z","title":"arXiv preprint arXiv:2501.14851 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.930407Z"},"links":{"cited_paper":"/paper/2501.14851","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:8cf4ee2bbb777660d094cf098b0b2901c6b2d485055521f4ef4862972c5280c6","observation_id":"1d6aa5bc-2a07-47f9-8374-28c6e9e277b0","resolution":{"observed_at":"2026-08-07T12:44:31.930407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.457602Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"325bd4e9-ca91-42aa-afef-0945116300a1","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.026529Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:b2273c04743ca8d3046a456c216690d3e7003162f9a1254532c89af7f5ab37d6","observation_id":"71b7280e-9268-4942-ae0b-d9bd554abc3b","resolution":{"observed_at":"2026-08-07T12:45:07.547709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02735","last_updated":"2025-05-05T15:37:00Z","snapshot_observed_at":"2026-08-07T23:36:07.412083Z","submitted_at":"2025-05-05T15:37:00Z","title":"FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02735","snapshot_observed_at":"2026-08-07T12:44:32.091734Z","title":"arXiv preprint arXiv:2505.02735 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.091734Z"},"links":{"cited_paper":"/paper/2505.02735","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:8762c8ce7d6a9b16f971575cf4405551bd37ebb833e76a2bb9834fd44dd50254","observation_id":"60b402ce-04b2-4459-b5f6-e38590f0a660","resolution":{"observed_at":"2026-08-07T12:44:32.091734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.228929Z","title":"European Semantic Web Conference , pages=","venue":null,"work_id":"9bc5f375-39a8-4ab5-a3c2-7ce6b5ac437a","year":2023},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.198014Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:1ea13b610ef50fce70ea652abbc2a0c7b0be0dc889e372cb1d4888d27b87cf59","observation_id":"f4f4de7f-479c-4700-a2e9-6569fef31de5","resolution":{"observed_at":"2026-08-07T12:45:07.332701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.295139Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.295139Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:daccf2a1b5c7c90d77ce58d54ea491eadcc7ef8ed095eb956f948bb2b716dcff","observation_id":"8c2e8861-ca7c-4252-972b-efc4ed7283d9","resolution":{"observed_at":"2026-08-07T12:44:32.295139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.383467Z","title":"Proceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.383467Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:f61964c1127b41e261ca4c88f913060052d5bb7191fbec8a06396ad6a4dbc1a5","observation_id":"94a50989-6931-4d0e-a9fa-d8b75f58de0a","resolution":{"observed_at":"2026-08-07T12:44:32.383467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:44:32.454833Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.454833Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:0f462681f57909f2d04083a3b00d21aa756b3c455e3ccc5a135c717a4e16bb9f","observation_id":"68e4a836-098f-4d8f-b437-4c400f68a726","resolution":{"observed_at":"2026-08-07T12:44:32.454833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.804754Z","title":"Proceedings of the 2021 conference of the North American chapter of the association for computational linguistics: human language technologies , pages=","venue":null,"work_id":"bbfe9f83-ae5e-41a5-877a-dee865ef74ad","year":2021},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.497238Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:4e2eac099492c46d967c0ab93010e7b97789c1164703891e045fe980eed274c2","observation_id":"70309c71-8603-499e-99da-07f30a0a32c8","resolution":{"observed_at":"2026-08-07T12:45:06.985875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.549221Z","title":"Findings of the association for computational linguistics: EMNLP 2020 , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.549221Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:1f7388780ce2c65ada2e53987eac17e7117fe516f95eabbcf6f0bae921edfb51","observation_id":"cfb01546-9fc0-4fbd-97f4-7857da88a24e","resolution":{"observed_at":"2026-08-07T12:44:32.549221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.456394Z","title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"45d8032e-37a5-40d1-bcd9-0fef064d672e","year":2022},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.617451Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:17ab7adf404e8d5f0ef7ce3b5fb722c7221111d04d05cd3ae8b637075881c112","observation_id":"a7228e6f-6477-4bf1-98c1-836015154b6f","resolution":{"observed_at":"2026-08-07T12:45:06.595044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.281891Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"f168172b-396c-4fd5-89a0-c60dd07c6f02","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.703087Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:6fd2e2193990e211e9b1b8ca849f798268acf8da79a049a342ed77866ae4246a","observation_id":"2d72a67a-258c-4fa6-8534-0578564f6b3c","resolution":{"observed_at":"2026-08-07T12:45:06.360053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.795670Z","title":"C row S -Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.795670Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:378aaa28b560f866c98d0b7a22fd1c3890d9b91e2f9f512bbc22790c3ec5d748","observation_id":"e8d60a6d-d40b-46f5-8eb6-d5ffcf91416b","resolution":{"observed_at":"2026-08-07T12:44:32.795670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.209312Z","title":"Transactions on Machine Learning Research , doi =","venue":null,"work_id":"98019e76-d756-4e03-a8fb-16e9c149bbf3","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.882722Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:a9f364ff790d4c73a3a1e5ba3695f56ad57c91e295aa19e340f1751cc7d09c5d","observation_id":"b47d6d3e-4761-4dc4-a5f8-a6b66cf1012b","resolution":{"observed_at":"2026-08-07T12:45:06.241243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.978703Z","title":"ACM transactions on intelligent systems and technology , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.978703Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2aea73fe56e4e1c5ae31fc6fb4a3c00764ecf0110619686d284073b733ff175e","observation_id":"8ef6a630-248e-4bea-aecf-078d979fbb64","resolution":{"observed_at":"2026-08-07T12:44:32.978703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.102903Z","title":"Transactions on machine learning research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.102903Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:33f37d38c027fa2eda57ee1f98e459501fb87e30b1064150aaf87d02d690764d","observation_id":"7776f9c7-d798-446f-a516-ba187f2bbd87","resolution":{"observed_at":"2026-08-07T12:44:33.102903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:44:33.168261Z","title":"arXiv preprint arXiv:2009.03300 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.168261Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ab222536bf8e6ca849692ca5b021404ddca12c317d89de2fcf706ecd385a21dd","observation_id":"83be2d93-8c2c-4244-b90c-003d12d088db","resolution":{"observed_at":"2026-08-07T12:44:33.168261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.260360Z","title":"Findings of the Association for Computational Linguistics: NAACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.260360Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:0b979e808cc83405d07264369c32a85c8ccab72252602ad5e65dcd4f8096c499","observation_id":"fe0054e4-ac38-4184-9bbe-44a120d787cb","resolution":{"observed_at":"2026-08-07T12:44:33.260360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.369494Z","title":"P ro SA : Assessing and Understanding the Prompt Sensitivity of LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.369494Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:abbde6ce2fa3ebeccdc43750b649a795aa7a9f6a01429eb25f9966bfa04810ea","observation_id":"086b3cad-130d-45e1-8776-16f61cd85221","resolution":{"observed_at":"2026-08-07T12:44:33.369494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.461520Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.461520Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d3bb45aa0961a1cbd8993f7f9af0d2edb8467b9bc856e099be9c2089f0a07ec2","observation_id":"f92216a6-268c-4b31-bd92-8fc6e0a4b4bb","resolution":{"observed_at":"2026-08-07T12:44:33.461520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.804763Z","title":"Proceedings of the 1st ACM workshop on large AI systems and models with privacy and safety analysis , pages=","venue":null,"work_id":"27ae2031-3d3f-4be6-9678-07a4bbf9df55","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.550095Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:3e4152ba561422c151a6ef264c068d4370cd3561b6cbfc2cc154509954076618","observation_id":"1e24bf35-9c64-4a7b-aa78-09c43b5ead4d","resolution":{"observed_at":"2026-08-07T12:45:05.861608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08329","last_updated":"2024-01-16T12:49:00Z","snapshot_observed_at":"2026-07-06T17:16:08.962172Z","submitted_at":"2024-01-16T12:49:00Z","title":"Understanding User Experience in Large Language Model Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08329","snapshot_observed_at":"2026-08-07T12:44:33.653851Z","title":"arXiv preprint arXiv:2401.08329 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.653851Z"},"links":{"cited_paper":"/paper/2401.08329","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:05d385b8fe4c9cbe8126f36ac279bc63d1ac277324d4b5ed9fa50316cb067390","observation_id":"fe0a5809-6866-4f94-a79c-1da3448024a0","resolution":{"observed_at":"2026-08-07T12:44:33.653851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T12:44:33.736893Z","title":"arXiv preprint arXiv:2403.04132 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.736893Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:72120176208a160a75e75fdd760683f016025be235abbfb82ad060206fbccd24","observation_id":"d46bb22a-b864-4e17-9d3f-89312334bcac","resolution":{"observed_at":"2026-08-07T12:44:33.736893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.562104Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"010dacb5-5262-49c2-87b5-7e0dab963a7d","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.804536Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7d37a741233310f417b207db92548414050a3bda45788da343c1c75cfb6a8b28","observation_id":"a8b092d3-0c98-4656-96af-edda0a1640e5","resolution":{"observed_at":"2026-08-07T12:45:05.649164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.856791Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.856791Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:401bf88377134a04513ac1afd65dabf258d126ed3dd44351ef556fc2f8ac886c","observation_id":"0c553b29-49b6-4375-aa24-bdf47c7ce632","resolution":{"observed_at":"2026-08-07T12:44:33.856791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.930656Z","title":"arXiv preprint arXiv:2509.19364 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.930656Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:6e1f2a0f408bc3c764bd9702acaab7c2fd491c2456a75cbf5cf889a0d9c197f9","observation_id":"da414d8c-eecd-4044-b747-d975df546e44","resolution":{"observed_at":"2026-08-07T12:44:33.930656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.324508Z","title":null,"venue":null,"work_id":"d1ead390-f188-41ce-ab63-ecc49ae4b2f5","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.991547Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:93489b879141c57c2beb6b8da275957cdd5fdf2b39612a8d56e5bcffa6bec5aa","observation_id":"2e3f3f2b-b54d-4663-a092-ccc87aea3b80","resolution":{"observed_at":"2026-08-07T12:45:05.404673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.071960Z","title":"2023 , isbn =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.071960Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ec362d570efbbb99cd69cccf1fefcd8ab3471c75b94fa7928ffcea299ebe572a","observation_id":"9a9935d0-f7b6-46d0-acd9-2b2a9276d937","resolution":{"observed_at":"2026-08-07T12:44:34.071960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12095","last_updated":"2023-08-29T05:34:25Z","snapshot_observed_at":"2026-08-05T13:57:45.408890Z","submitted_at":"2023-02-22T11:01:20Z","title":"On the Robustness of ChatGPT: An Adversarial and Out-of-distribution Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12095","snapshot_observed_at":"2026-08-07T12:44:34.189426Z","title":"arXiv preprint arXiv:2302.12095 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.189426Z"},"links":{"cited_paper":"/paper/2302.12095","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d5e992906db889e06401a3080ea63787a4b4e7852ba14c0a6774f9c3f3553a3f","observation_id":"6161cf9b-f2c6-4a51-bb84-19e368a3ece4","resolution":{"observed_at":"2026-08-07T12:44:34.189426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.260166Z","title":"Ask Again, Then Fail: Large Language Models' Vacillations in Judgment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.260166Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d4661ae0911e27dd23da43c5ca7d2994f166b15d27ada8c6e895f39e9d40cbc5","observation_id":"9dccb30e-fa97-4f3c-9bda-fba0e3b7e762","resolution":{"observed_at":"2026-08-07T12:44:34.260166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.316712Z","title":"S iren ' s Song in the AI Ocean: A Survey on Hallucination in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.316712Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d4d6493454573b17349bd51d841016c0e32287967070531dceefc17a64d8b125","observation_id":"c0b012f5-87a5-48b6-bcab-0b05fd694512","resolution":{"observed_at":"2026-08-07T12:44:34.316712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.409924Z","title":"Proceedings of the 2021 ACM conference on fairness, accountability, and transparency , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.409924Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:35eb593d96bd43a57a7a46b412d4beadf066956a31de89cc9d1ac2135caba539","observation_id":"b346a3ab-f126-4e6a-bc5c-5e514e1e25f6","resolution":{"observed_at":"2026-08-07T12:44:34.409924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03738","last_updated":"2023-11-13T17:50:22Z","snapshot_observed_at":"2026-08-07T07:55:04.700807Z","submitted_at":"2023-04-07T17:14:00Z","title":"Should ChatGPT be Biased? Challenges and Risks of Bias in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03738","snapshot_observed_at":"2026-08-07T12:44:34.503503Z","title":"arXiv preprint arXiv:2304.03738 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.503503Z"},"links":{"cited_paper":"/paper/2304.03738","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:4e75bd9392d7bf7f2fa3e5f802d87fa37f80d5b0b5bebd1c802e12387ab4b8f4","observation_id":"15f074f6-1ad5-452b-af55-9103cc4219d2","resolution":{"observed_at":"2026-08-07T12:44:34.503503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06188","last_updated":"2026-02-20T15:48:56Z","snapshot_observed_at":"2026-07-06T22:54:44.656835Z","submitted_at":"2026-02-20T15:48:56Z","title":"LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06188","snapshot_observed_at":"2026-08-07T12:44:34.565332Z","title":"arXiv preprint arXiv:2604.06188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.565332Z"},"links":{"cited_paper":"/paper/2604.06188","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:cc4d0eace93a4c437e4fa5f9090fc0c728dccc25d80f4bda51fe9d2b5b0c04df","observation_id":"1313c07f-0d7c-4d4e-9d24-d81a7fb31217","resolution":{"observed_at":"2026-08-07T12:44:34.565332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.062391Z","title":"Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society , number=","venue":null,"work_id":"8f32e741-31c6-4ddd-9c46-1a1b2a1ee41f","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.623847Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:aab616d22749a2db56b124152a479c350423a0f530494e78e2bd37d0a9e5996e","observation_id":"a458f07a-0ffa-4f31-865f-231be2c48040","resolution":{"observed_at":"2026-08-07T12:45:05.151838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.835565Z","title":"Practices for","venue":null,"work_id":"f7adf6e7-f238-4eab-9e63-39710f768f4b","year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.700820Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7e4f9b750ce060e51519e1ff9b80bae885bfd9df6c36fd8e7ce99b18c11ebbbb","observation_id":"96133c27-3520-4a5a-9715-6591749ebe40","resolution":{"observed_at":"2026-08-07T12:45:04.934779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.590969Z","title":null,"venue":null,"work_id":"a30fd396-9d4f-462e-b3de-13e65634add7","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.816885Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:bccbea4f97e0f48659d1c274882ff9a8ae4039918f1256a366eee27b471be46e","observation_id":"856bbd95-784c-4347-abaf-daea68706d34","resolution":{"observed_at":"2026-08-07T12:45:04.655486Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02275","last_updated":"2023-02-17T16:08:22Z","snapshot_observed_at":"2026-08-06T11:22:24.347810Z","submitted_at":"2020-08-05T17:59:16Z","title":"Aligning AI With Shared Human Values","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02275","snapshot_observed_at":"2026-08-07T12:44:34.935769Z","title":"arXiv preprint arXiv:2008.02275 , year=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.935769Z"},"links":{"cited_paper":"/paper/2008.02275","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:78c1819633ca989eb912cc5e973d27c2b1d9a019295713c973e54abcb706ed0e","observation_id":"f43044d6-d349-4364-bbd8-fb8fb3bedbbb","resolution":{"observed_at":"2026-08-07T12:44:34.935769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05336","last_updated":"2025-03-13T00:09:08Z","snapshot_observed_at":"2026-08-07T17:22:23.185186Z","submitted_at":"2025-03-07T11:23:48Z","title":"Toward an Evaluation Science for Generative AI Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05336","snapshot_observed_at":"2026-08-07T12:44:35.042357Z","title":"arXiv preprint arXiv:2503.05336 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.042357Z"},"links":{"cited_paper":"/paper/2503.05336","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:1a5f9597a4e9a14f0a613594e1947020b178837e4bf5e6a64c1417f905b8c346","observation_id":"d834dcae-40d0-4cbc-95ab-648cf68eb808","resolution":{"observed_at":"2026-08-07T12:44:35.042357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.125805Z","title":"Science , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.125805Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:32505ab2d2bb5a6d9bf7dfb7d33662c139b0ce4fa290d823721833ec764d1cc8","observation_id":"daa23e92-20a0-4295-a933-fcdb476df63d","resolution":{"observed_at":"2026-08-07T12:44:35.125805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/392","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:02.893684Z","title":null,"venue":null,"work_id":"991cdf2e-a8ae-426c-b087-b33bae58e32e","year":2022},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.232606Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:88ee630d5c5d8ee40769ab08ecf7af5ad56b1447f33fbc7462473ccf7a929cf8","observation_id":"0ca37549-c4c5-45e5-970c-15f40d1808ec","resolution":{"observed_at":"2026-08-07T12:45:02.931158Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03597","last_updated":"2024-12-02T20:49:21Z","snapshot_observed_at":"2026-08-05T12:03:49.244891Z","submitted_at":"2024-12-02T20:49:21Z","title":"The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03597","snapshot_observed_at":"2026-08-07T12:44:35.307850Z","title":"arXiv preprint arXiv:2412.03597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.307850Z"},"links":{"cited_paper":"/paper/2412.03597","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:8b2ca0e2bf44c79c585b0441490dc31dd678cf86f4dcc0f3810af3e4c1b799ab","observation_id":"7bcf96d0-68e2-4d3c-b056-ed6c588043bb","resolution":{"observed_at":"2026-08-07T12:44:35.307850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.393890Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.393890Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:6eec1c69d0243bd7cd3b312f1c9b5dd19e8e24d952a0c600383712cdb0885292","observation_id":"05b8b964-fc11-4886-a522-ddbc7f20ed3f","resolution":{"observed_at":"2026-08-07T12:44:35.393890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15366","last_updated":"2021-11-26T19:39:34Z","snapshot_observed_at":"2026-08-07T00:21:07.584753Z","submitted_at":"2021-11-26T19:39:34Z","title":"AI and the Everything in the Whole Wide World Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15366","snapshot_observed_at":"2026-08-07T12:44:35.451657Z","title":"and Paullada, Amandalynne and Denton, Emily and Hanna, Alex , year = 2021, month = nov, eprint =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.451657Z"},"links":{"cited_paper":"/paper/2111.15366","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:208f30b3df6a6ddf57f3cf54bb30e74e57bc860df4b8c692ff92480dcf4fa2e5","observation_id":"09ebe1db-820d-48ac-9d25-7ef4f3d17a2b","resolution":{"observed_at":"2026-08-07T12:44:35.451657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.498690Z","title":"Proceedings of the 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.498690Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:9027daae32fbaf75d2b66faf529ccd60ca3a66808fea17163655efcedb0dd932","observation_id":"c3f7131e-5e38-46df-9f2a-7ea4c19805f0","resolution":{"observed_at":"2026-08-07T12:44:35.498690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.593629Z","title":"Rethinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.593629Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:6e9a945ac721f9885c840f47daf228d5c721932de1cf1a13b9cc83a9e832f054","observation_id":"2808b874-9e30-4988-997d-b30941a981eb","resolution":{"observed_at":"2026-08-07T12:44:35.593629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00561","last_updated":"2025-06-06T22:15:14Z","snapshot_observed_at":"2026-07-06T20:29:36.154633Z","submitted_at":"2025-02-01T21:09:51Z","title":"Position: Evaluating Generative AI Systems Is a Social Science Measurement Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00561","snapshot_observed_at":"2026-08-07T12:44:35.707630Z","title":"arXiv preprint arXiv:2502.00561 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.707630Z"},"links":{"cited_paper":"/paper/2502.00561","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:3602b0ead7f748e4a38525950169e5921db44835122be92ef2959697de63851b","observation_id":"90fdb2a7-d6a1-4bdf-a364-b147057f1c14","resolution":{"observed_at":"2026-08-07T12:44:35.707630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.776696Z","title":"Outsider","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.776696Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:0935d061ebf5f8524ccde9c1d33ffc84a121f58ee0d5bada069043d01c185147","observation_id":"2ff3cc6b-80e4-4297-a894-ab5196b95f4d","resolution":{"observed_at":"2026-08-07T12:44:35.776696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11986","last_updated":"2023-10-31T18:23:32Z","snapshot_observed_at":"2026-08-02T09:23:01.679296Z","submitted_at":"2023-10-18T14:13:58Z","title":"Sociotechnical Safety Evaluation of Generative AI Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11986","snapshot_observed_at":"2026-08-07T12:44:35.836468Z","title":"arXiv preprint arXiv:2310.11986 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.836468Z"},"links":{"cited_paper":"/paper/2310.11986","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7cf8201eb26a5477e075044c28cfff5ee8fca3021b66fc7e5279bc3a761ff3dc","observation_id":"7a18bd0c-da49-4965-981a-f5c1d621b604","resolution":{"observed_at":"2026-08-07T12:44:35.836468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-07T12:44:35.911671Z","title":"arXiv preprint arXiv:2405.14782 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.911671Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:bf36147de1b17f3351967cd25c0969c1151e341ad2c25131da2d16c39c71ec5d","observation_id":"3825143f-fd23-4b60-8b37-122987b4325c","resolution":{"observed_at":"2026-08-07T12:44:35.911671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.334647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"705a2d5b-f6df-4604-bd7d-6484c930db09","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.996295Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:55e834737da15e7d744739b82e8c6f3b6a8fcbe886e984aa3d94f41a67872ebf","observation_id":"095f31e1-3024-4640-83ae-201405d6b4e2","resolution":{"observed_at":"2026-08-07T12:45:04.439156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.095112Z","title":"Proceedings of the 29th international conference on computational linguistics , pages=","venue":null,"work_id":"c430b6c7-ea6f-4299-b8cd-73f758be2b5e","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.106520Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:31a4a17bbb6361835fe4dbd9598852811b070dc773302d4138110e27549209ba","observation_id":"19b54a70-5013-4aab-b741-c30f055a0581","resolution":{"observed_at":"2026-08-07T12:45:04.212267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:36.193313Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.193313Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2023dd6bcddaccef32966906083272ca0bff9b8e2817efe606ca914d2e78339a","observation_id":"b7ea2215-28e0-437e-82e8-bb84696ebfb7","resolution":{"observed_at":"2026-08-07T12:44:36.193313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:36.278667Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.278667Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ff88c2cc4f77caaac49e85ab38a0de301e409f509f297262d2ca8964a6e2a7c4","observation_id":"4e9c0f34-3323-44d4-89bd-3ce922ffa349","resolution":{"observed_at":"2026-08-07T12:44:36.278667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-07T12:44:36.345910Z","title":"arXiv preprint arXiv:2504.12516 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.345910Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:add7d785859ea501fe86d4d1187b19a7b1980a96d1aeebba076bb7f8c83e4fcb","observation_id":"d7b4a3c1-3323-44c2-8021-4b673020cabd","resolution":{"observed_at":"2026-08-07T12:44:36.345910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506.05334","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:37.315551Z","title":"and Darrell, Trevor and Norouzi, Narges and Gonzalez, Joseph E","venue":null,"work_id":"21eb19dc-1554-441e-a6ef-71c0bd4d5b19","year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.435665Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:122a17921a675ff1a18765db3d76d77fa150ac9d90128d283760051f5c1f4cc3","observation_id":"91789132-3150-4b20-8918-30ab698702b7","resolution":{"observed_at":"2026-08-07T12:45:02.704440Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2511.18931","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:37.089214Z","title":null,"venue":null,"work_id":"8c1d3714-9da1-463f-afa4-58ce954b7130","year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.563039Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7c4a0beddfea650d1b6c636fce9f26f7e841419acafca707737fc71dfcc65bb8","observation_id":"198004bf-5cd5-4244-8dbd-4afd50b28c74","resolution":{"observed_at":"2026-08-07T12:44:37.153884Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:03.871126Z","title":"Sacred or","venue":null,"work_id":"483fcab3-fb0d-4167-825f-b12812784147","year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.672670Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:330deea255a2a9d8d59057bbcdef3bab65da423a5c3ae6c94a656bead67ee027","observation_id":"26b99a95-b552-483f-91de-7b8bd9d9cc69","resolution":{"observed_at":"2026-08-07T12:45:03.955485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-08T13:22:08.459736Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09038","snapshot_observed_at":"2026-08-07T12:44:36.752949Z","title":", year = 2025, month = jun, number =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.752949Z"},"links":{"cited_paper":"/paper/2506.09038","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:fb20fbb373cbfd70a2091f2ee82d7e62acbc9d8a122d184455f5212ed10be90c","observation_id":"5a6ad17b-8612-40c6-a6b1-a94cab07c62f","resolution":{"observed_at":"2026-08-07T12:44:36.752949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7887.37630","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:03.255950Z","title":"and Metaxa, Dana","venue":null,"work_id":"4b145654-89c5-43ec-9cac-50dbb28cc04d","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.796636Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:3aee34adfac9f732034109e7faa30c0ccb702f89d612b0cc5efdbc5810731982","observation_id":"b1e89b97-aa78-4cdf-87ea-310d3df49387","resolution":{"observed_at":"2026-08-07T12:45:03.305534Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:36.850378Z","title":"Proceedings of the 2020 conference on fairness, accountability, and transparency , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.850378Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:a27ae096ab283d84133b5d10a64352a189873319cd7cfb49197dfbdbb31a3036","observation_id":"af29f3f7-4e3a-4bc3-9c8a-b23f72efdb87","resolution":{"observed_at":"2026-08-07T12:44:36.850378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16861","last_updated":"2025-03-25T05:12:04Z","snapshot_observed_at":"2026-08-07T16:47:29.242326Z","submitted_at":"2025-03-21T05:09:46Z","title":"In-House Evaluation Is Not Enough: Towards Robust Third-Party Flaw Disclosure for General-Purpose AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16861","snapshot_observed_at":"2026-08-07T12:44:36.904062Z","title":"arXiv preprint arXiv:2503.16861 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.904062Z"},"links":{"cited_paper":"/paper/2503.16861","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:047f304fbad97ff781b6bfb76013a95cb8d59894881c1e49edf9084cc77ea547","observation_id":"4b748991-47bb-4794-885b-a35805ba49ce","resolution":{"observed_at":"2026-08-07T12:44:36.904062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","latest_version":1,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-09T16:12:43.693548Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":44,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2608.06202."}