{"as_of":"2026-08-11T04:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7300c407e8cddf78d51f466efd3bd396f37d82b09e7c4c3141a3aad6309266d","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:08:17.955891Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00482/citation-record","integrity":"/paper/2506.00482/integrity","json":"/paper/2506.00482/citation-record.json","paper":"/paper/2506.00482"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:09.977304Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:09.977304Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ed468663c418f4ee796e2db3df359b6f0f0aa482efaf88ac16db48561581d3af","observation_id":"f5b9bc80-2b88-42ea-94a2-c81776cfe024","resolution":{"observed_at":"2026-08-07T12:08:09.977304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17761","last_updated":"2025-06-11T16:56:58Z","snapshot_observed_at":"2026-08-10T23:21:51.391688Z","submitted_at":"2024-06-25T17:45:26Z","title":"CaLMQA: Exploring culturally specific long-form question answering across 23 languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17761","snapshot_observed_at":"2026-08-07T12:08:10.073701Z","title":"CaLMQA: Exploring culturally specific long-form question answering across 23 languages.arXiv preprint arXiv:2406.17761, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.073701Z"},"links":{"cited_paper":"/paper/2406.17761","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e53c906a44d39ee0be34b183041062be3ea296e099784752dc8970ab83509935","observation_id":"2efa816f-2096-493c-9719-742628342339","resolution":{"observed_at":"2026-08-07T12:08:10.073701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T12:08:10.157068Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.157068Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:2bd8377f21e52e67a71841644ab421f9dccf678da6a33b61ebbb49938a877188","observation_id":"427b5538-3fc3-4592-a80a-46dc79315ec1","resolution":{"observed_at":"2026-08-07T12:08:10.157068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:10.225114Z","title":"Axolotl: Scalable fine-tuning framework for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.225114Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ef837e6f9dd76ab89cad709f0960b1021ef37d4c6af4ec660a31aad921c81011","observation_id":"02652e39-b34d-480a-8d59-119b86945385","resolution":{"observed_at":"2026-08-07T12:08:10.225114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:10.311875Z","title":"PIQA: Reasoning about physical commonsense in natural language.Proceedings of the AAAI Conference on Artificial Intelligence, 34(05):7432–7439, Apr","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.311875Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:349c27ea3b300c53e5a238a2b8ca9681697f6f92034d06fd6233df6e31e2ce52","observation_id":"70cf9db4-a008-4061-b223-5319f8215fd2","resolution":{"observed_at":"2026-08-07T12:08:10.311875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:08:10.404642Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.404642Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a95529e251c5e2376222617179b4c045e2978191267d1c1938dfbab596d5a325","observation_id":"7c7944e0-cd66-499e-acff-4d0ee4f76357","resolution":{"observed_at":"2026-08-07T12:08:10.404642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.787887Z","title":"Angelopoulos, Tianle Li, Dacheng Li, Banghua Zhu, Hao Zhang, Michael I","venue":null,"work_id":"ba76edee-bb29-4b8f-b6a3-7069c2e9cf55","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.504819Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:70998513c902e72a8e9ae78228857cfaeb0ab434914ad38b52ed5a6a78fce196","observation_id":"f7e73d9e-db43-402d-8436-39b403c66e3a","resolution":{"observed_at":"2026-08-07T12:08:28.925972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02677","last_updated":"2025-06-03T01:56:26Z","snapshot_observed_at":"2026-08-10T14:16:58.257214Z","submitted_at":"2024-10-03T17:04:31Z","title":"CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02677","snapshot_observed_at":"2026-08-07T12:08:10.604298Z","title":"CulturalBench: a robust, diverse and challenging benchmark on measuring the (lack of) cultural knowledge of LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.604298Z"},"links":{"cited_paper":"/paper/2410.02677","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:cad103e7fd2365fbf492611a129364dfd09c95ffba1eccc2545a50340c0910ff","observation_id":"6deff245-bd09-4939-867c-5908395d103e","resolution":{"observed_at":"2026-08-07T12:08:10.604298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T12:08:10.688904Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.688904Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:0b00623c2690ec1ceb2dcbc7a1be4b87a72d89c01650ccd92081c848840aac9d","observation_id":"793c3c87-6d02-4ab3-aa89-120a638244cf","resolution":{"observed_at":"2026-08-07T12:08:10.688904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:08:10.759064Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.759064Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ce3daa652d417991c602e4a13466588dfa22f97f67777478d4355394156d02fe","observation_id":"2828d71c-cc47-4304-8dec-f632bc8c7838","resolution":{"observed_at":"2026-08-07T12:08:10.759064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:08:10.838533Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.838533Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:bcf0ab182c2e2971328fc1d6130a0a9f0fe7e5d7de076cbb336421ab16f50a25","observation_id":"072cf44b-c212-4d71-b7d3-1275b99ec56c","resolution":{"observed_at":"2026-08-07T12:08:10.838533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.596766Z","title":"SciEx: Benchmarking large language models on scientific exams with human expert grading and automatic grading","venue":null,"work_id":"c80688cf-5689-4012-b387-5737865d419c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:10.913333Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ddf7db113ad3353a1c37c40dcf888a350faef04fb23f48cc502af14db1647371","observation_id":"144866f4-6643-48b7-b0de-4ca0fff94548","resolution":{"observed_at":"2026-08-07T12:08:28.653087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:08:11.040928Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.040928Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:95985f080657eb8dcda768fb03e86922341f45433fea4f15dc683263a570808d","observation_id":"c622398f-affd-4769-8e73-e3cb93c2f173","resolution":{"observed_at":"2026-08-07T12:08:11.040928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:08:11.143287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.143287Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ec60f01374d6ecd9d441df265715532cd9df78b1c6679a9d2ec16ec90871641a","observation_id":"8c027e46-3d15-4ef3-8b6c-d084e209aa6b","resolution":{"observed_at":"2026-08-07T12:08:11.143287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09823","last_updated":"2025-05-30T14:06:34Z","snapshot_observed_at":"2026-08-07T10:08:12.334437Z","submitted_at":"2024-07-13T09:34:00Z","title":"NativQA: Multilingual Culturally-Aligned Natural Query for LLMs","version":3},"cited_work":{"arxiv_id":"2407.09823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.09823","snapshot_observed_at":"2026-08-07T12:08:18.292504Z","title":"NativQA: Multilingual Culturally-Aligned Natural Query for LLMs","venue":"cs.CL","work_id":"feabbf90-ef23-4d28-9f2e-91119897b54d","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.225092Z"},"links":{"cited_paper":"/paper/2407.09823","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e20c17b2288147eb0b978077942e727bc7e661a10a470adea93c58c19a8e26e6","observation_id":"d306e540-5cc0-4a1f-b69b-a6d272c47262","resolution":{"observed_at":"2026-08-07T12:08:18.380004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:11.314107Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.314107Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7e2990d9c9ef2e04bc156c6a6b30ccb2e265f2292b18dc7fa170fa1d90f1b89c","observation_id":"a19cbe23-d5a2-425a-beb6-719f4e207aa6","resolution":{"observed_at":"2026-08-07T12:08:11.314107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:11.398525Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.398525Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:4d25efc12c7030f15f6ea30fedf08558fc1d2533f7e9356058597688e82fca16","observation_id":"5c2d87d0-10fe-4bec-862b-7d175d674e06","resolution":{"observed_at":"2026-08-07T12:08:11.398525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.342774Z","title":"MedQA-SWE - a clinical question & answer dataset for Swedish","venue":null,"work_id":"6d9199a2-8048-4da1-bbfa-e1acf2167696","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.541072Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:833dfae06da220015088daf5d91314704c20de6b42ea2265079855d16a6ef56c","observation_id":"e2c7b2e9-2678-4c5d-807b-1346ce605d34","resolution":{"observed_at":"2026-08-07T12:08:28.428624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-08-10T10:23:31.465008Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-07T12:08:11.651962Z","title":"Liger kernel: Efficient triton kernels for llm training.arXiv preprint arXiv:2410.10989, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.651962Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e7f1c79222ee6281910f1956ee75116d051953685f9486691253359a5838d79d","observation_id":"91da4474-d693-434e-be15-8ab7ed1a45b5","resolution":{"observed_at":"2026-08-07T12:08:11.651962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04428","last_updated":"2025-07-04T03:19:53Z","snapshot_observed_at":"2026-08-10T00:31:45.865113Z","submitted_at":"2024-06-06T18:15:01Z","title":"MoralBench: Moral Evaluation of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04428","snapshot_observed_at":"2026-08-07T12:08:11.740741Z","title":"MoralBench: Moral evaluation of LLMs.arXiv preprint arXiv:2406.04428, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.740741Z"},"links":{"cited_paper":"/paper/2406.04428","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:89ad547d1798cfa15d4c683e1ceadd5e0e30394e974aae41fb36c12b383190d6","observation_id":"b0849f0c-eafa-4615-97f2-6f26cd597f58","resolution":{"observed_at":"2026-08-07T12:08:11.740741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:28.046724Z","title":"KoBBQ: Korean bias benchmark for question answering.Transactions of the Association for Computational Linguistics, 12:507–524, 2024","venue":null,"work_id":"956fc9d3-cab5-41c5-b1c6-fd7e1bf4a08c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.856041Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:6f3f1b53ea3e94c4f6763f4b114b09cf25285c6fefb15c161fdf32f6a0b0a2e8","observation_id":"384af186-ac2b-4525-9d81-b3fc01d6e567","resolution":{"observed_at":"2026-08-07T12:08:28.176490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:27.785054Z","title":"Dynabench: Rethinking benchmarking in NLP","venue":null,"work_id":"a96c0c49-e918-41b1-a30f-aac935dedee3","year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:11.960334Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:11b1c3877d9662f9d2d3f623f651bc7b0a95c2d6c71be4c106e072ebae14cd3b","observation_id":"b5c7092a-64d8-4ce1-afb6-19c1b56f2281","resolution":{"observed_at":"2026-08-07T12:08:27.926812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:27.468824Z","title":"CLIcK: A benchmark dataset of cultural and linguistic intelligence in Korean","venue":null,"work_id":"f6bc4938-5a21-4b52-8633-22c57c36aaec","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.098448Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ad8cf459fce62ca9d6e1adcb0e258935934f3ebb56c950f0eb0ba5a485c8a988","observation_id":"7c1e2b82-d1b1-49cf-8110-794e6fa5f3f2","resolution":{"observed_at":"2026-08-07T12:08:27.623537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:27.218353Z","title":"Developing a pragmatic benchmark for assessing Korean legal language understanding in large language models","venue":null,"work_id":"a1738b4f-1078-44e7-ab84-15edf4af5786","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.199734Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e4ec0baadc9ac04c471577e7b34652e198b9ec1f6c70ba6950eb1408e9c5ef54","observation_id":"1db570e7-318b-486f-88f3-dddbcd66b252","resolution":{"observed_at":"2026-08-07T12:08:27.371801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02448","last_updated":"2025-01-31T07:32:07Z","snapshot_observed_at":"2026-08-10T22:10:21.484408Z","submitted_at":"2025-01-05T05:57:22Z","title":"Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02448","snapshot_observed_at":"2026-08-07T12:08:12.304393Z","title":"Understand, solve and translate: Bridging the multilingual mathematical reasoning gap.arXiv preprint arXiv:2501.02448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.304393Z"},"links":{"cited_paper":"/paper/2501.02448","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e5f5587b6186f17de52884ad90362ac5fee0368bc9058f1d76105cf1c3e55fea","observation_id":"8c49a033-ff53-4aec-b58c-66fc59956c6d","resolution":{"observed_at":"2026-08-07T12:08:12.304393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:26.803300Z","title":"The NarrativeQA reading comprehension challenge","venue":null,"work_id":"fafe9c82-4b60-4343-ab13-b06f3f5b1f08","year":2018},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.414934Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:74ba238ba5710da81d2885ff72e208281dcc581f9fad4ee906d329f982cca1ea","observation_id":"5623cccb-be36-42ef-b4fe-07c8e3111493","resolution":{"observed_at":"2026-08-07T12:08:27.027075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01469","last_updated":"2024-12-09T06:52:13Z","snapshot_observed_at":"2026-08-09T12:50:05.588270Z","submitted_at":"2024-03-03T10:31:49Z","title":"KorMedMCQA: Multi-Choice Question Answering Benchmark for Korean Healthcare Professional Licensing Examinations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01469","snapshot_observed_at":"2026-08-07T12:08:12.530994Z","title":"KorMedMCQA: multi-choice question answering benchmark for korean healthcare professional licensing examinations.arXiv preprint arXiv:2403.01469, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.530994Z"},"links":{"cited_paper":"/paper/2403.01469","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:0117ed2c92aea246f5b3c93fc72cc64903e3df5fb2a12784e6a5f0c62cbd363c","observation_id":"7b21840f-e276-48e2-99dc-7b9e718c39b8","resolution":{"observed_at":"2026-08-07T12:08:12.530994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:12.613938Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.613938Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:4c7fb63cf84fed4aa69f4aac43b13107ad7f2273ccf3109fdcab2df9bdc0a767","observation_id":"51d8d5d0-d31e-4d17-9557-1320c5baa8c3","resolution":{"observed_at":"2026-08-07T12:08:12.613938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:26.551678Z","title":"KoSBI: A dataset for mitigating social bias risks towards safer large language model applications","venue":null,"work_id":"ba757104-f19a-43fe-a300-48d0aa9b6152","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.725096Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:53fdca41ace6a7f2742b0fce2cae755e6d8f20827c8fe9a73102681cc42fafd9","observation_id":"6c3d54d9-ab05-4870-a72c-8534c0f1cf09","resolution":{"observed_at":"2026-08-07T12:08:26.686665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:26.280697Z","title":"KorNAT: LLM alignment benchmark for Korean social values and common knowledge","venue":null,"work_id":"6773a2ad-3b6f-4a98-b4b5-bc50c0e882c4","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.848365Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:d31df4b8c3f94c1978207b1bdb0d5c2405fe7661fb5ebbf483f4deeae8ec6b29","observation_id":"aa081316-6729-4805-b54c-00c92fb35d73","resolution":{"observed_at":"2026-08-07T12:08:26.394750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17259","last_updated":"2024-12-23T04:02:46Z","snapshot_observed_at":"2026-07-06T20:11:55.722067Z","submitted_at":"2024-12-23T04:02:46Z","title":"LegalAgentBench: Evaluating LLM Agents in Legal Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17259","snapshot_observed_at":"2026-08-07T12:08:12.933539Z","title":"LegalAgentBench: Evaluating LLM agents in legal domain","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:12.933539Z"},"links":{"cited_paper":"/paper/2412.17259","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:61d7fd211b5cc38451b4f10f1ce6540f0bf7c5830e37cecfea17e5af6aefbda2","observation_id":"6b5fb4e9-c1fb-4fef-982b-9a5323918bb6","resolution":{"observed_at":"2026-08-07T12:08:12.933539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.950435Z","title":null,"venue":null,"work_id":"7df34952-f61f-414c-87dd-e40493e3a624","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.031385Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:5c7ed900306181dcfbba937be55b6dec8062b82ccddab6a522820b72441b1b59","observation_id":"67f7a762-27b5-4fb1-b424-061269a1fc1d","resolution":{"observed_at":"2026-08-07T12:08:26.087765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:13.117735Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.117735Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:cf3e58cc9855b4d3e49989a635d9fbc060b222f9b018290b9f48c2cda27f4a98","observation_id":"0d952236-2223-4d8c-ad29-5afd2ade9bda","resolution":{"observed_at":"2026-08-07T12:08:13.117735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.785191Z","title":"Benchmark data repositories for better benchmarking","venue":null,"work_id":"f93ac7f4-c2ac-4325-b3ec-2b3be8d6c24c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.193135Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:904d12902a2b741bb298415b773f0212b245910b1c680b66ed00f239eae3fcf3","observation_id":"9543c30d-1994-4996-b889-20b8a5679c43","resolution":{"observed_at":"2026-08-07T12:08:25.844219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.478462Z","title":null,"venue":null,"work_id":"860df4da-709f-4f08-8c45-da4a71ff02eb","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.299417Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:94311b620e0d79c26769d730afeff00161a02df9e8d858009c2bd5713841e9c4","observation_id":"8efbfdfb-c22c-4d53-8960-c00821637f53","resolution":{"observed_at":"2026-08-07T12:08:25.663250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:25.224213Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"5f34373d-321b-4050-9eb0-d4228f68ffe5","year":2018},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.416530Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c8f84c79462571e7e2783e4cc76660b8e9d751bc488c47df40e7fc4685ce3439","observation_id":"3e283af4-44c8-41ed-937e-5f530e085286","resolution":{"observed_at":"2026-08-07T12:08:25.342672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.997447Z","title":"FActScore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"d6378f34-543c-4d17-834e-fe3439ec82d1","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.497724Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:45523461cc5e57d7e6f2f74ddfdb0c04ee474d52e3952953bfe00bb6558e80f4","observation_id":"ab79f9d2-19ed-49ae-92f0-8831166b35e3","resolution":{"observed_at":"2026-08-07T12:08:25.078670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14996","last_updated":"2025-06-08T14:56:13Z","snapshot_observed_at":"2026-08-07T16:52:48.017259Z","submitted_at":"2025-03-19T08:45:03Z","title":"Right Answer, Wrong Score: Uncovering the Inconsistencies of LLM Evaluation in Multiple-Choice Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14996","snapshot_observed_at":"2026-08-07T12:08:13.563546Z","title":"Right answer, wrong score: Uncovering the inconsistencies of llm evaluation in multiple-choice question answering.arXiv preprint arXiv:2503.14996, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.563546Z"},"links":{"cited_paper":"/paper/2503.14996","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:50ff7057335c02ff90d60f58506f47317a8d04dee862c5b99d6a048b4bb4ee30","observation_id":"e86d7949-42bc-49ed-886f-eb7ae1559373","resolution":{"observed_at":"2026-08-07T12:08:13.563546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.720883Z","title":"BLEnD: A benchmark for llms on everyday knowledge in diverse cultures and languages","venue":null,"work_id":"f1f5563b-3217-44e6-a9b7-f4820383c98b","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.674542Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:6dd6f0c490bc3b4c25c345176835b8e34f608ca90f0f3e82613176d1c24c2487","observation_id":"970e71b2-80f9-4235-8a20-6bc47dc0dba2","resolution":{"observed_at":"2026-08-07T12:08:24.796108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.411164Z","title":"Extracting cultural commonsense knowledge at scale","venue":null,"work_id":"13bd1c89-93c9-4da7-964d-7cf6edeb2500","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.809086Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:397e916bc1907883186ba450b40473449a19995e0c0f47b03fb1c8260fe0efbf","observation_id":"b746cf2b-6230-403e-8f8f-4ca4330ee10b","resolution":{"observed_at":"2026-08-07T12:08:24.597620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.154469Z","title":"MixEval: Deriving wisdom of the crowd from LLM benchmark mixtures","venue":null,"work_id":"b7cab4d7-4d10-47ca-baca-45c6355889e3","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.880832Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7edb741d2a59a105ebddd346574acc70adec56c361e760a5fdd45b20e64d6705","observation_id":"dc5d50d0-ff3c-4ea3-9cf0-2eff798a6137","resolution":{"observed_at":"2026-08-07T12:08:24.233222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:13.986625Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:13.986625Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c9ac0dfa32c30fb247d28a2fb9660f2241b93d40ba09b22492217b437090e22d","observation_id":"a167dabf-4945-4a79-84f1-5217c4f6ea1f","resolution":{"observed_at":"2026-08-07T12:08:13.986625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.884405Z","title":"BBQ: A hand-built bias benchmark for question answering","venue":null,"work_id":"d0cf95b4-4bbe-4c5f-90df-7fd80f57354f","year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.078274Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:36aaa7a899537984affb0f338904968b7fb926fcc7b556cb1b1f84ced476d62a","observation_id":"c92b6544-3460-43fc-b53b-4942d32311cf","resolution":{"observed_at":"2026-08-07T12:08:24.031957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00860","last_updated":"2024-10-30T16:37:50Z","snapshot_observed_at":"2026-08-10T12:21:04.789879Z","submitted_at":"2024-10-30T16:37:50Z","title":"Survey of Cultural Awareness in Language Models: Text and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00860","snapshot_observed_at":"2026-08-07T12:08:14.144191Z","title":"Survey of cultural awareness in language models: Text and beyond.arXiv preprint arXiv:2411.00860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.144191Z"},"links":{"cited_paper":"/paper/2411.00860","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:5e85facfb91e6b56958dcd85e34084e1d6b15a6aa68f5b7d1829026c65da1e14","observation_id":"b115779b-e43d-467f-9b5d-3848fd76cf1a","resolution":{"observed_at":"2026-08-07T12:08:14.144191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.580325Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models","venue":null,"work_id":"58fd5263-c126-4ccd-8d0a-0a321b512770","year":2020},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.231714Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:33085429b1d3b10020ad70168229602bd0eb5b2b72e614c20db66bd24c89dd97","observation_id":"434e5316-32d9-4fce-937c-0ebbae8b572c","resolution":{"observed_at":"2026-08-07T12:08:23.722060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.254477Z","title":"NormAd: A framework for measuring the cultural adaptability of large language models","venue":null,"work_id":"07a1bda5-a4c6-44ea-88d4-f3048d257ebe","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.335556Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:fd08d7c7111682060628b877d12be8ee51f731d1869a182ff7942e40ab2cbfee","observation_id":"431e4c29-6e41-4595-958d-42b3722aa736","resolution":{"observed_at":"2026-08-07T12:08:23.401621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.922562Z","title":"DiversityMedQA: A benchmark for assessing demographic biases in medical diagnosis using large language models","venue":null,"work_id":"e57402d0-9469-475f-9e8b-3c3a3571c58c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.581006Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:d4bbe1f1a6f9a5d9a3c695662d40405cda9a2f4c9303db3a5b9c24693e7c4b4f","observation_id":"5fc97c41-d2a5-466c-9cd3-876a0506eda3","resolution":{"observed_at":"2026-08-07T12:08:23.085948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.670158Z","title":null,"venue":null,"work_id":"c39b3a76-5398-44ba-8654-b8e0551b4062","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.691459Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:038f533a1d603de4aacb858db46c53cffc7830681bb6d1718700de47526aa058","observation_id":"a931e440-3305-4057-84b3-49e2394adb4d","resolution":{"observed_at":"2026-08-07T12:08:22.795446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.478722Z","title":"Kochenderfer","venue":null,"work_id":"050560bd-7ab5-4501-a55b-edbe0e0af7bb","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.833051Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8a757179ca6e30b1bb14447969cc39e4c0e9653ef5fd4c1848d7e972e323e22d","observation_id":"29c42e3f-8d2a-4402-9d66-c368ccbf24cb","resolution":{"observed_at":"2026-08-07T12:08:22.550842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.277229Z","title":"WinoGrande: an adversarial winograd schema challenge at scale.Commun","venue":null,"work_id":"f00554d7-8b0c-4e21-b539-d14fbe0d5891","year":2021},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.924761Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:262469229e5b8c6e6f2a07d1a779d34ce0373d2e97261e539a4a5ccca0c6bf09","observation_id":"32256750-95a7-49dc-bd84-fbcc2c0f5f5e","resolution":{"observed_at":"2026-08-07T12:08:22.369793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.056867Z","title":"Social IQa: Commonsense reasoning about social interactions","venue":null,"work_id":"27b96a7d-9901-48b8-b890-e58b4a76d526","year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.015768Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c537dbbb0d2919330c48dadf6444e934c1606c0bea835e54808f7b62793fd164","observation_id":"cc6416ba-d929-4711-95aa-cd19b259b7d7","resolution":{"observed_at":"2026-08-07T12:08:22.146589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.798174Z","title":"Benchmarks as microscopes: A call for model metrology","venue":null,"work_id":"b7ceb100-9431-4e6a-bc97-10803a9e3c20","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.107192Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:8d9bb3523312db47210dc5db62fc260f4f9be03092cc33fe0d136c44ebf8e210","observation_id":"597877f1-8911-4dba-b89d-f29fbcd96adb","resolution":{"observed_at":"2026-08-07T12:08:21.940061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.556843Z","title":"Multi-fact: Assessing factuality of multilingual llms using factscore, 2024","venue":null,"work_id":"06323b99-5899-4b37-a786-b822bf319beb","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.229945Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:b2453bff32173e4a9bbe6055d91891d74e50a960abd499187cafe4d611d9138d","observation_id":"7db6d897-08bd-47d6-854d-be04c1ce887e","resolution":{"observed_at":"2026-08-07T12:08:21.694305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01833","last_updated":"2025-04-02T15:40:24Z","snapshot_observed_at":"2026-08-07T16:14:17.068940Z","submitted_at":"2025-04-02T15:40:24Z","title":"YourBench: Easy Custom Evaluation Sets for Everyone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01833","snapshot_observed_at":"2026-08-07T12:08:15.321570Z","title":"Yourbench: Easy custom evaluation sets for everyone.arXiv preprint arXiv:2504.01833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.321570Z"},"links":{"cited_paper":"/paper/2504.01833","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:4cf24a341748ff457092241da65375878c6ea3e885e39c53f1f3b6b58d8b75a0","observation_id":"1d3478be-d6f6-4cab-b9db-7783e1a7ad1d","resolution":{"observed_at":"2026-08-07T12:08:15.321570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.255500Z","title":"CultureBank: An online community-driven knowledge base towards culturally aware language technologies","venue":null,"work_id":"b2b6b82c-c715-4ed5-84e8-95423eb1e54f","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.440338Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:b64a84e35a9b4cd2f1276015e8cd496a4713efd32e679a73c7687b6e6f4a00be","observation_id":"ac95e546-01e9-4a9e-b94c-0804e1c866ba","resolution":{"observed_at":"2026-08-07T12:08:21.384899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-08-11T01:11:58.185123Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-07T12:08:15.542569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.542569Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:e842eb4d9ca098677ee327ae3d3a4fcf730ee770246c1c69047b4a0c0c3cc41c","observation_id":"2632e0cc-e035-437f-9565-3dfdb648bb34","resolution":{"observed_at":"2026-08-07T12:08:15.542569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.078408Z","title":"KRX bench: Automating financial benchmark creation via large language models","venue":null,"work_id":"236d8aab-e93c-44f9-9dbb-b81c8e256243","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.639270Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7e21deb47b73171663e06bf0b7ce78c62e5a45f86a2f55e05e4c7b1b041ff35f","observation_id":"26e37416-51ce-415c-9642-e621f807dab6","resolution":{"observed_at":"2026-08-07T12:08:21.170385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01505","last_updated":"2023-06-25T18:06:25Z","snapshot_observed_at":"2026-08-10T12:22:28.869093Z","submitted_at":"2023-04-30T04:36:05Z","title":"Beyond Classification: Financial Reasoning in State-of-the-Art Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01505","snapshot_observed_at":"2026-08-07T12:08:15.739015Z","title":"Beyond classification: Financial reasoning in state-of-the-art language models.arXiv preprint arXiv:2305.01505, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.739015Z"},"links":{"cited_paper":"/paper/2305.01505","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:2c378dd2ed1e5742134de539758677c01db194724ab576cc7942dcf9a40db646","observation_id":"ad0d7d1a-0d36-4340-9651-9a858d447735","resolution":{"observed_at":"2026-08-07T12:08:15.739015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.877454Z","title":"Multi-step reasoning in Korean and the emergent mirage","venue":null,"work_id":"d09da19a-b8d7-476c-ac2a-95d89409dc1c","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.828572Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:87f2e557f7446693260e25089195b177562b2d51769a8fda6ff7943f406fa8a4","observation_id":"3201edf1-4f3e-4d99-a74a-b41de35e9f1c","resolution":{"observed_at":"2026-08-07T12:08:20.945080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.681082Z","title":"KMMLU: Measuring massive multitask language understanding in Korean","venue":null,"work_id":"e2816e51-64f2-4b55-9252-5ec218df0003","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.911316Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:a2343c1f4647bf24be171d7d2b35d76e8ce475aa81afb981ceab482e79182694","observation_id":"624cdaba-8ce7-4ba1-b8f4-cfe3cd287df1","resolution":{"observed_at":"2026-08-07T12:08:20.774825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.472673Z","title":"HAE-RAE bench: Evaluation of Korean knowledge in language models","venue":null,"work_id":"d52acaab-d741-48a8-acbf-f65cac04c692","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.003057Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:2fd51150e7b3cf8846105e8f1c02fc135faced791594698480fb61a11a16c17a","observation_id":"062acff7-3666-48da-83a3-d3376048856b","resolution":{"observed_at":"2026-08-07T12:08:20.551437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.307052Z","title":"Challenging BIG-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"02eead44-754b-4b67-a112-0d9eab08fe4e","year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.099651Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ae19e2ce568caf9465c1c9474d44a952693a8e41bb769893734fe03ce8bfe27d","observation_id":"51cdb724-54f3-47c5-9fc7-280e106df693","resolution":{"observed_at":"2026-08-07T12:08:20.366551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02257","last_updated":"2024-10-15T18:37:03Z","snapshot_observed_at":"2026-07-06T19:10:04.150678Z","submitted_at":"2024-09-03T19:31:03Z","title":"MMLU-Pro+: Evaluating Higher-Order Reasoning and Shortcut Learning in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02257","snapshot_observed_at":"2026-08-07T12:08:16.178310Z","title":"MMLU-Pro+: Evaluating higher-order reasoning and shortcut learning in llms.arXiv preprint arXiv:2409.02257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.178310Z"},"links":{"cited_paper":"/paper/2409.02257","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:be44bc3621d6bfbacf5e9167d6a9c49695fa29c77a818bd78ec507cb85d02409","observation_id":"f7a0cb8e-86be-4b03-ac03-4c9eb57a57ad","resolution":{"observed_at":"2026-08-07T12:08:16.178310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:16.285247Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.285247Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:415b16340df89c476a5252bf513b5c37e8fd5bf2a55c707720828848ae6c833c","observation_id":"432bf232-706d-4036-b311-207966c0a5a0","resolution":{"observed_at":"2026-08-07T12:08:16.285247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T12:08:16.366173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.366173Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:23185052dc6a47bc326ed981835e3a17da63412ae04bd778b81a695b6fddaf04","observation_id":"00d892b9-90c2-4f7b-a54b-7846b57cd4c5","resolution":{"observed_at":"2026-08-07T12:08:16.366173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.108331Z","title":"Benchmark suites instead of leaderboards for evaluating AI fairness.Patterns, 5(11):101080, 2024","venue":null,"work_id":"e371971e-7704-42e8-a2e5-1eb26a571980","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.462836Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:746fa99ef670c0e4e69a0a468380fbc5ee931f7a62f3581f087bf04f54a4472c","observation_id":"4b644f29-8f98-4946-a501-c1d937aec4bd","resolution":{"observed_at":"2026-08-07T12:08:20.206356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.917545Z","title":"SeaEval for multilingual foundation models: From cross-lingual alignment to cultural reasoning","venue":null,"work_id":"81749611-4dcf-4773-8b5e-867ff82b79d8","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.586923Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:dd4f4d3daf32c6b499efaf3849c0b6b33c36ffe5c0899f23f646ffe4930e503e","observation_id":"6098c32e-3b67-48eb-92a2-d20244f6f03a","resolution":{"observed_at":"2026-08-07T12:08:19.993735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07251","last_updated":"2024-12-10T07:20:51Z","snapshot_observed_at":"2026-08-01T07:08:12.448245Z","submitted_at":"2024-12-10T07:20:51Z","title":"KULTURE Bench: A Benchmark for Assessing Language Model in Korean Cultural Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07251","snapshot_observed_at":"2026-08-07T12:08:16.759287Z","title":"KULTURE Bench: A bench- mark for assessing language model in Korean cultural context.arXiv preprint arXiv:2412.07251, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.759287Z"},"links":{"cited_paper":"/paper/2412.07251","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:eaf5c86631910801c2b167f8484e3e64b7267d2be853c7bb48402df84f59fe07","observation_id":"1fd0d21e-54f8-4e60-83f6-9b48a90b3a76","resolution":{"observed_at":"2026-08-07T12:08:16.759287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.745569Z","title":"Super-NaturalInstructions: Generalization via declarative instructions on 1600+ NLP tasks","venue":null,"work_id":"3da439e7-f237-4029-a6f2-25d968a5f8df","year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.857171Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:1b8f3a5799bbd7e69fcb1c8a2e18950381d74fdb17f210e5b089360c60a381f2","observation_id":"49db165a-1c43-4554-97df-544abd4e6381","resolution":{"observed_at":"2026-08-07T12:08:19.840752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.552242Z","title":"MMLU-Pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"a75c1979-a521-47b7-afb0-8234d4d9d65c","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.951540Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ae70f43018e3d0ad9289e4afa1f72be3fa8414c4d353dbfdda82def353ff0b4e","observation_id":"af13bd18-0319-4209-a00e-594f1aa283f0","resolution":{"observed_at":"2026-08-07T12:08:19.656148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05336","last_updated":"2025-03-13T00:09:08Z","snapshot_observed_at":"2026-08-10T07:59:57.547080Z","submitted_at":"2025-03-07T11:23:48Z","title":"Toward an Evaluation Science for Generative AI Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05336","snapshot_observed_at":"2026-08-07T12:08:17.035975Z","title":"Toward an evaluation science for generative AI systems.arXiv preprint arXiv:2503.05336, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.035975Z"},"links":{"cited_paper":"/paper/2503.05336","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:5360243bcb426381ee61fa6c256696750b90fa15f84b001033125fd03868334b","observation_id":"f44943f3-cb76-4bfa-aeeb-bf86bf08a589","resolution":{"observed_at":"2026-08-07T12:08:17.035975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T12:08:17.152295Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.152295Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:6c936c926141c8fb4e922c0ed7e59300203de4726e01f7ee455e801157e928c4","observation_id":"a3199245-1f8c-4d78-958b-bed6e0247619","resolution":{"observed_at":"2026-08-07T12:08:17.152295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:08:17.279546Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.279546Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:335bac384b58f7cb4f7d39f0cc8c35890bbcd35e6d632dd9d45ed65439c01a01","observation_id":"e2d4076c-8373-42b7-bbb3-a99321d88f7a","resolution":{"observed_at":"2026-08-07T12:08:17.279546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-07T12:08:17.369531Z","title":"Rethinking benchmark and contamination for language models with rephrased samples.arXiv preprint arXiv:2311.04850, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.369531Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:ee7ac22c8c208619af993ab07b3f27bfdea1f044d5119fbabe696aa91140fafc","observation_id":"0a0588e0-0c37-4bd2-95fb-f1c7e168d36e","resolution":{"observed_at":"2026-08-07T12:08:17.369531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.345420Z","title":"FLASK: Fine-grained language model eval- uation based on alignment skill sets","venue":null,"work_id":"3ec9009a-7ccc-48b3-b64e-c511931ebc86","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.447929Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:61f1ae061f4ad0a1df296b78a8a91a6f62d1ca80d8ef3064eec7ee57fc030185","observation_id":"bc172362-c9b7-4ef7-9b97-e23956a44a2b","resolution":{"observed_at":"2026-08-07T12:08:19.440683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.190681Z","title":"GeoM- LAMA: Geo-diverse commonsense probing on multilingual pre-trained language models","venue":null,"work_id":"dfef4512-8347-47a3-bbc9-82a0f178c908","year":2022},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.503711Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:f3c599a664bfb22f8ac8fdc2afc8a2e3f81ccab90aaa8952118894abfdf0af8b","observation_id":"7da61289-4ca5-42d3-86b8-83542a2efdc6","resolution":{"observed_at":"2026-08-07T12:08:19.253520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:17.614168Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.614168Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:fe5128acb07361b667d64d8096c476a53abd8a9c4e76215d33faf7225e7c93e6","observation_id":"725c2996-fa56-420c-b4f4-d17e36ae7af6","resolution":{"observed_at":"2026-08-07T12:08:17.614168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.051182Z","title":"Maruf Hossain, Guang- Jie Ren, Kate Soule, Yifan Mai, and Yada Zhu","venue":null,"work_id":"4ffa2e02-955f-4b89-b3e4-ca95011fde49","year":2025},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.692121Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:bd62a4cdad93f8cf0e483b9b4039abe2865fa3f4658a41141d62e146d7117f8b","observation_id":"ad13bf2f-b95b-429a-96e4-7f7b91ef36e0","resolution":{"observed_at":"2026-08-07T12:08:19.085125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.920738Z","title":"Task me anything","venue":null,"work_id":"93f0d2dc-0ce9-44f2-bb51-47bb8d093339","year":2024},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.749553Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:1525b53f1777fdc69831677712b393728b520beb59bdea817110d5670828324e","observation_id":"29a84389-3535-41e3-85c8-51ccf4318ed9","resolution":{"observed_at":"2026-08-07T12:08:18.975615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.796635Z","title":"Users can interactively explore the overall data distribution they are interested in","venue":null,"work_id":"eff66f0d-7954-4d75-9a44-9a76395dc40d","year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.836203Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c887bed804583ae930023b0120640ef2c9ffdb43530b9cd4dbfc0fca665fafda","observation_id":"86d268ff-e827-4c90-a2e4-463393160202","resolution":{"observed_at":"2026-08-07T12:08:18.847818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.686907Z","title":"By reviewing samples, users can verify whether the dataset matches their needs and explore datasets suitable for their purposes","venue":null,"work_id":"4dbedd8c-4f21-4aa1-9737-4bd624fe6987","year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.905218Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:36b8cb1212275cd6753d5e03287227c5cba8679edb4deb342ccdc3b697bd86c9","observation_id":"e0de9c67-b6cb-47e7-acf9-528c7ec99ed7","resolution":{"observed_at":"2026-08-07T12:08:18.739965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.555287Z","title":"Is the Earth flat?","venue":null,"work_id":"0637a14b-4681-49e5-9536-13a1d29ea058","year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.955891Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:c73fee1956618ed5abb77cc256188122e7606fed4734c766159e67f268dce8d8","observation_id":"7f2adf41-922e-4c81-9f4c-6dc5c22c83cd","resolution":{"observed_at":"2026-08-07T12:08:18.606763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:16.678445Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.678445Z"},"links":{"citing_paper":"/paper/2506.00482"},"observation_digest":"sha256:7104f1af34efed4e9f74d3f5c56866d68704fb81875a1b6889548bdc65a71ff9","observation_id":"88c7fafc-7f12-49be-82bc-bc53c5530e79","resolution":{"observed_at":"2026-08-07T12:08:16.678445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00482","last_updated":"2025-05-31T09:24:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T14:27:19.748022Z","submitted_at":"2025-05-31T09:24:32Z","title":"BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2506.00482."}