{"as_of":"2026-08-19T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7215d9798c8f3ab7d0ee9828daa7016cc36361b092bc65b390b1e0d94918bbf5","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:49:34.499531Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T04:07:56.287352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:28:44.552688Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"cited_work":{"arxiv_id":"2412.01020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01020","snapshot_observed_at":"2026-07-03T17:28:44.552688Z","title":null,"venue":null,"work_id":"55abd529-1965-456d-8779-965ec8917b36","year":2024},"citing_paper":{"arxiv_id":"2606.15633","last_updated":"2026-06-17T05:23:30Z","snapshot_observed_at":"2026-08-16T16:32:31.632020Z","submitted_at":"2026-06-14T06:50:28Z","title":"Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T04:07:56.287352Z"},"links":{"cited_paper":"/paper/2412.01020","citing_paper":"/paper/2606.15633"},"observation_digest":"sha256:14dd451036d0c98e7922659b3b866ad6c6ee053b973aa1b31340b49f8fa525ee","observation_id":"ddab16a9-f941-4960-9d2b-7ecee0ac701b","resolution":{"observed_at":"2026-07-03T17:28:44.554094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01020/citation-record","integrity":"/paper/2412.01020/integrity","json":"/paper/2412.01020/citation-record.json","paper":"/paper/2412.01020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.489998Z","title":"https://aisafetybulgaria.c om/","venue":null,"work_id":"686703b7-e494-4bf5-824f-eb4ebde116c9","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.275900Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:96f16e57850dfb64cb788d4021a6ade08edd2c5a223a6ca4a403511326011be5","observation_id":"959064f1-1cef-4252-906d-e03d12c2d360","resolution":{"observed_at":"2026-08-12T04:49:35.494189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.476676Z","title":"Tpcx-ai - an industry standard benc hmark for artiﬁcial intelligence and machine learning systems","venue":null,"work_id":"8bfecb71-1994-49b8-9dcc-ef24b672a9ee","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.280630Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:88de3e12f895962dd32607063613fa8dd63dbb835b78caee0e0b4243b23820d7","observation_id":"768576e5-db86-4bd5-b740-1828ab195762","resolution":{"observed_at":"2026-08-12T04:49:35.481294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.464210Z","title":"https://compl-ai.org/","venue":null,"work_id":"e8a0330e-6422-4b61-8dac-72ef9a61006d","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.285007Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:3891122450f19100961b022b88ec24a79592a276fb1067475faf1d64cb9ec6fe","observation_id":"595bf9b7-49cb-428f-8c43-23511f8d17b0","resolution":{"observed_at":"2026-08-12T04:49:35.468167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.289369Z","title":"Relevai-reviewer: A benchmark on AI reviewers for survey paper relevance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.289369Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:73602ffa15397ba5206722b760dc6ea6756ab5b0486c4ecd48d5ca221934b653","observation_id":"b852ae81-e737-4721-831a-9bfe82e099b8","resolution":{"observed_at":"2026-08-12T04:49:34.289369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.451491Z","title":"Robustbench: a standardized adversarial ro bustness bench- mark","venue":null,"work_id":"06d334fe-49ca-4693-bee0-562e991afe7c","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.293794Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:c91e2093839f8937647099b9439874c073455bb396ee33c651d89bff8b2ff86a","observation_id":"c5a99daa-ed8a-4c81-b982-79c205a95d25","resolution":{"observed_at":"2026-08-12T04:49:35.455802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.438201Z","title":"https://artiﬁcialintelligenceact.eu /the-act/","venue":null,"work_id":"672b3ed9-640f-468a-ae40-8218c650f10e","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.298264Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:316e4cae170261ece872b1d454f013412502ccf3d4c4a25ea7deb5719ce794a5","observation_id":"75850ed8-80ce-4434-8daf-38b73a9c410e","resolution":{"observed_at":"2026-08-12T04:49:35.442610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.424988Z","title":"https://di gital- strategy.ec.europa.eu/en/library/ethics-guidelines-trustworthy-ai","venue":null,"work_id":"6715e893-6837-4580-a814-0054b47a1fb3","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.302992Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:8d12a1add69c43f764c83d3e522fe3670d02585744e40c76cc2dd2020ca36853","observation_id":"b267cce2-1bd9-4cfc-9b5d-b9ab5095e816","resolution":{"observed_at":"2026-08-12T04:49:35.429455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.411497Z","title":"Compl-ai framework: A technical interpretation and llm benchmarkin g suite for the eu artiﬁcial intelligence act, 2024","venue":null,"work_id":"b552986b-cc4b-4d20-aa6d-75ae261660bc","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.307310Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:ae1a7e440304d97c3120cdc059e9a151f88a879e3d2adc209781e528c77bf81e","observation_id":"1232386a-9562-4f1a-a896-34461e041741","resolution":{"observed_at":"2026-08-12T04:49:35.416377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.396745Z","title":"Measuring massive multita sk language understanding","venue":null,"work_id":"e32453ae-e478-463c-92d2-3af269f26ec4","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.311537Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:54e283062ca379242a686f04be6f44b397771ccd376686949ff8f8ac0bb9da7d","observation_id":"ba014203-b1b9-423d-a334-fd5ee4d2adb7","resolution":{"observed_at":"2026-08-12T04:49:35.401262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.382461Z","title":"Measuri ng mathe- matical problem solving with the MATH dataset","venue":null,"work_id":"5c8d187e-72ad-441f-852f-6aeb5e7fc6b1","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.315694Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:2b11af12bdde159373c5efdfb35a621454137c7670e2c268c3db8df0ca1c2245","observation_id":"5d3b5543-7ead-435d-8400-7e2da9421296","resolution":{"observed_at":"2026-08-12T04:49:35.386821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.368468Z","title":"Weld, and Luke Zett lemoyer","venue":null,"work_id":"b9902ea3-39ac-42e5-9c15-28872fc3f973","year":2017},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.319762Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:940d5f7feec2d5b6b6279f3c042f5662e76f901c85de901784ed00d3468e61e2","observation_id":"8dcf9c9a-e335-440e-92ff-49c4d3a6b235","resolution":{"observed_at":"2026-08-12T04:49:35.373656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-16T15:40:20.636325Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-12T04:49:34.323908Z","title":"Openassistant conversations - democra tizing large lan- guage model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.323908Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:569be9f8620f3c2a25bed48c2ae1a6703f52360ed62977b5704c84ede83d2d9e","observation_id":"31d31134-2521-42bc-890c-fcb31d6d2140","resolution":{"observed_at":"2026-08-12T04:49:34.323908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.355077Z","title":"Back- doorllm: A comprehensive benchmark for backdoor attacks on large lan- guage models, 2024","venue":null,"work_id":"43f9132e-99b4-4441-99c7-1c6a29152e02","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.328632Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:f9986ca030bc1bb703ab3d6f4aac12565ed4535489721628bbe88632b0433cab","observation_id":"10e6adef-20f7-49ad-8eda-32d82c7a0935","resolution":{"observed_at":"2026-08-12T04:49:35.359667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.342620Z","title":null,"venue":null,"work_id":"27f9e4f4-2447-4bdd-a3fb-24c80ebf8155","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.332779Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:a969f4a78f1efd4713ced0f793541117c10f1b9747608e7a5969f86b2357a0fc","observation_id":"a3ab6eb7-bfbb-4464-ae23-cf7c389c373f","resolution":{"observed_at":"2026-08-12T04:49:35.346655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09107","last_updated":"2025-04-20T04:31:16Z","snapshot_observed_at":"2026-08-16T14:52:20.818858Z","submitted_at":"2023-10-13T13:52:15Z","title":"GLoRE: Evaluating Logical Reasoning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09107","snapshot_observed_at":"2026-08-12T04:49:34.337026Z","title":"Glore: Evaluating logical reasoning of large langua ge models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.337026Z"},"links":{"cited_paper":"/paper/2310.09107","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:3db6876c74323bd7379d620f2bfdc3b4193f4a6b4218a0bf2f0c4e0c7778c364","observation_id":"b024e696-d46b-48e5-baa3-d74efc343611","resolution":{"observed_at":"2026-08-12T04:49:34.337026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.329242Z","title":"Metabox: A benchmark plat- form for meta-black-box optimization with reinforcement l earning","venue":null,"work_id":"a3e6f943-8fa0-4fc3-8566-6a8b20a04cff","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.341499Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:a541486853fe017d8bce0c47eb181de223e37e117bcf6731bc877952f87bf12c","observation_id":"f9509a7b-ff82-44b9-8da8-450226793d40","resolution":{"observed_at":"2026-08-12T04:49:35.333475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.316741Z","title":"Ok-vqa: A visual question answering benchmark requi ring external knowledge, 2019","venue":null,"work_id":"d28d3e24-5ecd-471a-b5b9-b73d511fb40b","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.346322Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:05658622c9fb77b47867382b0a27c7fd2661810fbc7cb669c7cdbace2166edd4","observation_id":"4ab148b2-0aa1-4d3d-b87b-0a3b5c1f0b6e","resolution":{"observed_at":"2026-08-12T04:49:35.321026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.303615Z","title":"Abstractive text summarization u sing sequence- to-sequence rnns and beyond","venue":null,"work_id":"8346bb7d-cb06-4fe2-bd67-029ee2dc5bef","year":2016},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.351220Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:cd26e2a01a8ed82f7ddeb5f848917e80f48c2394982bd7bded99f55e7ba1432c","observation_id":"0fd44be2-0d82-4afa-b5ea-4905c02a7fc3","resolution":{"observed_at":"2026-08-12T04:49:35.308111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.289556Z","title":"Adversarial NLI: A new benchmark for natura l language understanding","venue":null,"work_id":"b809a962-a396-44de-a268-78ad4491ba86","year":2020},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.355412Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:481ea61c7fce7980b1ca8fa9d92e93bbe0e6126c1719699f251e4c479cc893b5","observation_id":"73b65f13-8f29-4de2-b2bf-a0fc493bcc68","resolution":{"observed_at":"2026-08-12T04:49:35.293849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.275585Z","title":"https://oecd.ai/en/ai-pr inciples","venue":null,"work_id":"350d3f50-fa14-4282-890c-8785f48f2fd1","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.359484Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:358d220b0d3fd741c0f7e3f2ac576d70932001d2ad7b4e8ea43700cdb5f9f9f6","observation_id":"caa6d431-23da-4cb6-a193-00024761feeb","resolution":{"observed_at":"2026-08-12T04:49:35.280799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.260807Z","title":"The LAMBADA dataset: Word prediction requir- ing a broad discourse context","venue":null,"work_id":"160c129d-2cfa-4596-a9ca-25ff1b328735","year":2016},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.363678Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:ccc55d2e4af0a301215185c555f2764aa09282995456af3d112b215298ecbfa7","observation_id":"a9363cd5-ffaf-4dcd-91b5-f9b2e87961e3","resolution":{"observed_at":"2026-08-12T04:49:35.266378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T04:49:34.367867Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.367867Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:b12c6cd0beb70c32e52cd1d0bc726ef8cc8c4d6f7001cdfd3da31d04f5bd6012","observation_id":"de3aa830-3499-4d37-b28c-7f1490d7eda4","resolution":{"observed_at":"2026-08-12T04:49:34.367867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.247716Z","title":"Winogrande: An adversarial winograd schema challenge at sc ale","venue":null,"work_id":"13558313-1603-476c-9c51-aff9ba72d3f5","year":2020},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.372425Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:31ed6ac3e3837027a56f9ad549797075eb9bfd9d17ee60e34dbab30bbd69fbf0","observation_id":"32cc2676-71cc-441d-a613-b2dc3c66fdad","resolution":{"observed_at":"2026-08-12T04:49:35.251863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.234616Z","title":"Hadﬁel d, Richard Ngo, Konstantin Pilz, George Gor, Emma Bluemke, Sarah Shoker, Ja net Egan, Robert F","venue":null,"work_id":"63c7d1ac-debb-4205-9776-660137c9ed43","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.376471Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:3462af7786d57fa98caaf7ab58c46e6750d98b626dd915a5a376b0be4dca09a0","observation_id":"6348edc0-763c-4d98-981e-065481892f0a","resolution":{"observed_at":"2026-08-12T04:49:35.239019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.219790Z","title":"Sur- vey of diﬀerent large language model architectures: Trends , benchmarks, and challenges","venue":null,"work_id":"78a9a473-5a2c-42fc-889a-ea3d191fdd4f","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.380505Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:99c912333a45b6996d2c8f8badcfbf183d396b5f35c2d83d8c1b7661770ee02d","observation_id":"141e0544-db56-4537-8ad7-db555dc02946","resolution":{"observed_at":"2026-08-12T04:49:35.224479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.206866Z","title":"Concep tnet 5.5: An open multilingual graph of general knowledge","venue":null,"work_id":"f7585d6f-1807-49a1-8838-913fb4bb6d87","year":2017},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.384428Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:b5e3d5dba14b6ec6e3756230340968a9c5102f3f8e40f98ca9c91bdb9d686cf6","observation_id":"5c0eef8c-bb5a-4fe3-8961-57df44b03318","resolution":{"observed_at":"2026-08-12T04:49:35.211305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.194172Z","title":"Musr: Testing the limits of chain-of-thought with multiste p soft reason- ing","venue":null,"work_id":"85f56d25-1c5e-41bd-9f7c-f7fe1e45a0a4","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.388365Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:d6f4ce4f6a311c0a8dd0696577e4a577ec9c91840a1d520cf853b708149030ae","observation_id":"8e2cb9b3-8344-4777-9005-28c997947f30","resolution":{"observed_at":"2026-08-12T04:49:35.198454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.180928Z","title":"Conﬂictbank: A benchmark for evaluating the inﬂuence of knowledge conﬂicts in llm, 2024","venue":null,"work_id":"2fe9b42a-ba88-4f91-ba96-95a72850e1b6","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.392518Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:cad4a03c75c59321132e1d775502f30e22eecc0e053ba55e653ed3678d4f0dda","observation_id":"a20935e0-0fbc-4411-88fd-e8cd5c050af2","resolution":{"observed_at":"2026-08-12T04:49:35.185345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.167001Z","title":"A corpus for reasoning about natural language gr ounded in photographs, 2019","venue":null,"work_id":"80fdab57-c453-4ef4-b8e3-1acfcaaf09bf","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.396498Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:2ead87d4b11279621a7223e4db80494dd26e856bcf2aa0b2c5e04555a6f7fb54","observation_id":"cf6d6eb4-7de6-4ec0-b3e1-a900a43a10d8","resolution":{"observed_at":"2026-08-12T04:49:35.172027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.152472Z","title":"Table meets llm: Can large language models understand struc tured table data? a benchmark and empirical study, 2024","venue":null,"work_id":"78963584-4bf1-4af5-9c33-daff6faac501","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.400470Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:e94dca3be8e6bd3858bbbbfed040586c9bc3a069829dca7bc85b8e5a2bc7b237","observation_id":"a87cdc31-c0d4-4d97-9ffc-8a2595dc2b75","resolution":{"observed_at":"2026-08-12T04:49:35.157059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.138451Z","title":"Le, Ed H","venue":null,"work_id":"5a5e04fb-d8e0-49ad-90cc-bd3bf58c38dd","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.404516Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:e13fe25272e67926ae60fba3c24d465390d8cbf5fbc27e30fd3aceaa39172388","observation_id":"436f95fd-5862-4c93-964f-41ceb378d71f","resolution":{"observed_at":"2026-08-12T04:49:35.142715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.124354Z","title":"Commonsenseqa: A question answering challenge targeting c ommonsense knowledge","venue":null,"work_id":"2a1b2659-4918-49de-b419-59351004a0b5","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.408653Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:b20d29db819146346b988a61e46f9bc51acc9f9d893af3bc90b7b97a9d6f7187","observation_id":"5870f8e5-7fd8-4410-af03-e0a4673eb9d5","resolution":{"observed_at":"2026-08-12T04:49:35.128940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.412604Z","title":"Ltlbench: Towards bench marks for evaluating temporal logic reasoning in large language mode ls","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.412604Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:a2c414183f3b3c5027f143ce3e8a6385eb62d6b7d994c7ea30d815422fdc0bf8","observation_id":"da8f0378-5315-42b6-87ca-298895d91458","resolution":{"observed_at":"2026-08-12T04:49:34.412604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.111265Z","title":"Kirkpatrick, Feiyi Wang, Tom Gibbs, Venkatram Vishwanath, Mallikarjun Shankar, Geoﬀrey C","venue":null,"work_id":"dae6bb6f-8b87-47cc-aab8-83c5cbeb2bbb","year":2022},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.416422Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:427c06ac7cb4456f59bc50405b6e1cc13bbea9806bfc84dc90c8ad1c1cfaee45","observation_id":"954456a9-cbf4-4331-b187-94545c406c76","resolution":{"observed_at":"2026-08-12T04:49:35.115471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.097832Z","title":"Madai, Emilie Wiinb lad Mathez, 25 Jesmin Jahan Tithi, Magnus Westerlund, Renee Wurth, and Rob erto V","venue":null,"work_id":"31e10e37-864f-4cba-9d05-708d1ca4fcb8","year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.420387Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:c5b921a2882074c7355a94a10b3f4a373ad2e2130cb1547e59e7e100ca888bcd","observation_id":"25f27a24-2548-4309-b237-0cff8158c062","resolution":{"observed_at":"2026-08-12T04:49:35.102325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12241","last_updated":"2024-05-13T20:46:10Z","snapshot_observed_at":"2026-08-16T13:59:43.819754Z","submitted_at":"2024-04-18T15:01:00Z","title":"Introducing v0.5 of the AI Safety Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12241","snapshot_observed_at":"2026-08-12T04:49:34.424309Z","title":"Ahmed, Victor A kinwande, Namir Al-Nuaimi, Najla Alfaraj, Elie Alhajjar, Lora Aroyo, Trupti Bavalatti, Borhane Blili-Hamelin, Kurt D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.424309Z"},"links":{"cited_paper":"/paper/2404.12241","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:167f9d44db604ba6a3f20087a25356ec20504b08c10d2bffcaa05d3a80e4574d","observation_id":"64a38680-7320-44cf-b4b3-208c97dd72fa","resolution":{"observed_at":"2026-08-12T04:49:34.424309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.084551Z","title":null,"venue":null,"work_id":"ba2f7603-1316-4fd2-b8c1-35363468a270","year":2020},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.428747Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:9990a0a320fd153edc8c2e083c5eaeecbecf1057398333ebbd46ad44f79d7565","observation_id":"8ef0f9f7-90d2-4a76-8294-9d88f86a62e0","resolution":{"observed_at":"2026-08-12T04:49:35.089272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.070638Z","title":null,"venue":null,"work_id":"dd912735-2e56-4591-8cb2-b83ce7ad362e","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.432590Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:9627a740580b95739bf37818063e30ab8149c04c7b068c7307cef5b16e62c14e","observation_id":"dd9703b6-3513-4e6c-b93a-19a841bcb088","resolution":{"observed_at":"2026-08-12T04:49:35.074927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10706","last_updated":"2020-07-10T21:40:34Z","snapshot_observed_at":"2026-08-04T09:25:12.687793Z","submitted_at":"2020-04-22T17:10:18Z","title":"CORD-19: The COVID-19 Open Research Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10706","snapshot_observed_at":"2026-08-12T04:49:34.436441Z","title":"Murdick, Devvret Ris hi, Jerry Sheehan, Zhihong Shen, Brandon Stilson, Alex D","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.436441Z"},"links":{"cited_paper":"/paper/2004.10706","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:e4c6617b39bc3e19ced43c0aed0a1acbdf341b9442355d58cac6044075276a08","observation_id":"9694d149-2b58-40a5-b696-3d6f82c39ce7","resolution":{"observed_at":"2026-08-12T04:49:34.436441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-12T04:49:34.440600Z","title":"Mmlu-pro: A more robust and challenging multi-task la nguage un- derstanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.440600Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:92987ccfa0ae881728d2f526c4e9a9124022880b1ad5cd0d312b935e90432236","observation_id":"12ca922d-2dcb-43e9-8888-3c4b06c828be","resolution":{"observed_at":"2026-08-12T04:49:34.440600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.056945Z","title":"CausalBench: A comprehensive benchmark for evaluating causal reasoning capabilities of large language models","venue":null,"work_id":"5a3832c7-c46a-4723-8258-15226b42e27e","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.444965Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:669a1f0aabe4f34dc448eca0c800777c0f3a020f07cc72252bd18e932a0c9d4a","observation_id":"758a8961-3d6a-4944-b487-63ddebaff14b","resolution":{"observed_at":"2026-08-12T04:49:35.061640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-12T04:49:34.448945Z","title":"Logicv ista: Mul- timodal LLM logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.448945Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:74e6e9c06304e601d9ed6c2386e3c8f2914c107828c496ce1236bc36c4fe3d3d","observation_id":"8c69c960-5975-41e9-98fb-689d2e8a499f","resolution":{"observed_at":"2026-08-12T04:49:34.448945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.042234Z","title":"Quick and (not so) dirty: Unsupervised selection of justiﬁcation sentences f or multi-hop ques- tion answering","venue":null,"work_id":"9709ffe2-1742-42da-9c83-2cc0560d639b","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.453224Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:62a9e2ff7d1cfd5a050c38202d9abf2fe086c0bbb35cd02733f64cc38e49d265","observation_id":"8a57a991-f3da-4a06-8e1a-a1c0b5aecbbe","resolution":{"observed_at":"2026-08-12T04:49:35.047700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.457155Z","title":"Eval- uating the quality of hallucination benchmarks for large vi sion-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.457155Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:414e04c5c6e0537adc85897d11bfa5408e7f452eff3ca703b71e5be6075ce63d","observation_id":"5e7dfec3-743e-430c-9517-9d9a8d40c46b","resolution":{"observed_at":"2026-08-12T04:49:34.457155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.027957Z","title":"https://z-inspection.org/","venue":null,"work_id":"47675535-45ea-43b6-8b66-bb54e5f383fc","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.461684Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:f4a8fe5ff492aba011185b32b1ce9ad2d636d9121bef748d2f921dde492cc198","observation_id":"20f81d44-da0d-41b9-ab53-27ec1ca13751","resolution":{"observed_at":"2026-08-12T04:49:35.032335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:35.014252Z","title":null,"venue":null,"work_id":"71ef333c-c5a7-4c69-974c-418211ecd662","year":null},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.465655Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:9171c03688104fe3a56bf000c005871be388abca8032c201879e23bebebd0ee3","observation_id":"42407999-af0d-4843-9c5c-43c813337483","resolution":{"observed_at":"2026-08-12T04:49:35.018580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.985684Z","title":"Hellaswag: Can a machine really ﬁnish your sentence? In Anna Korho- nen, David R","venue":null,"work_id":"a2760c6e-8f77-4195-b0ae-42b11ea71b42","year":2019},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.474079Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:29a17c9701b86cc4dc80c269f38ef37376fee1179ab6c8151bc33ba853868dca","observation_id":"8cc604dd-0a84-4bfb-ac5e-869ec535b2d4","resolution":{"observed_at":"2026-08-12T04:49:34.990279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07057","last_updated":"2024-12-06T14:21:06Z","snapshot_observed_at":"2026-08-16T13:44:16.373255Z","submitted_at":"2024-06-11T08:38:13Z","title":"MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07057","snapshot_observed_at":"2026-08-12T04:49:34.478030Z","title":"Benchmarking trustworthiness of multimodal large language models: A comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.478030Z"},"links":{"cited_paper":"/paper/2406.07057","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:0395331798439a61a359ccd94f27d7bce53148f0e51142090c0db6d2dd5c396a","observation_id":"79e80c6a-d471-4375-b5de-162f8947408f","resolution":{"observed_at":"2026-08-12T04:49:34.478030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.970870Z","title":"Reef- knot: A comprehensive benchmark for relation hallucinatio n evaluation, analysis and mitigation in multimodal large language model s, 2024","venue":null,"work_id":"1a37ae29-b538-4dd2-aa70-5f5ad8d1f163","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.482834Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:029e2d383c0e5d30e1a7c4d1839efbc4985f42949fd74bbdada7a78a521e6ec8","observation_id":"3f429688-6ded-4117-9a01-d6e88f1f15cd","resolution":{"observed_at":"2026-08-12T04:49:34.976392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.956191Z","title":"Revolutionizing data base q&a with large language models: Comprehensive benchmark and evalua tion, 2024","venue":null,"work_id":"b0d4fecd-234a-47f9-a8d4-d36499f4e878","year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.486810Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:00249a764af8f2d601e780391077c39ac9b3878e491ab7aae9087a4833505728","observation_id":"bb8602bc-0507-49ad-b393-0c6d3a0fdaff","resolution":{"observed_at":"2026-08-12T04:49:34.961429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-12T04:49:34.490762Z","title":"Instruction-followin g evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.490762Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:727560cf6e787ca237d060529df6c283b0be2642dd98180a4613518e607c8251","observation_id":"2207480c-5c0f-4a4c-9051-22aba14151ab","resolution":{"observed_at":"2026-08-12T04:49:34.490762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06349","last_updated":"2024-09-27T11:45:09Z","snapshot_observed_at":"2026-08-16T14:02:22.436539Z","submitted_at":"2024-04-09T14:40:08Z","title":"CausalBench: A Comprehensive Benchmark for Causal Learning Capability of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06349","snapshot_observed_at":"2026-08-12T04:49:34.495253Z","title":"Causalbench: A comprehensive benchmark for ca usal learn- ing capability of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.495253Z"},"links":{"cited_paper":"/paper/2404.06349","citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:2a880e7626e345c0f412ae775a1c10a15fc2995d267440a5a47dd1296ebcadfe","observation_id":"56dd0cbf-1cce-40a4-965c-225238405a70","resolution":{"observed_at":"2026-08-12T04:49:34.495253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.940683Z","title":null,"venue":null,"work_id":"0d02e6ef-e194-406f-9994-f67beb57b3e4","year":2021},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.499531Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:841b3edd62614c6bb6506d9983abd155416f2e8f24f8aabafd269c96cc4ed96c","observation_id":"cf60c4e1-4baf-46d8-b430-995295a8caff","resolution":{"observed_at":"2026-08-12T04:49:34.946685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:49:34.999745Z","title":null,"venue":null,"work_id":"c1ec3a1e-02c9-405b-97a5-1bafd958d827","year":null},"citing_paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T04:49:34.469869Z"},"links":{"citing_paper":"/paper/2412.01020"},"observation_digest":"sha256:0b039013ed98509fece68b13d8a93c5a9123391660bb11108fb62de94d9d388b","observation_id":"3c1835ad-51b0-4747-97f1-e0064a538d51","resolution":{"observed_at":"2026-08-12T04:49:35.004190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01020","last_updated":"2024-12-02T00:38:57Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T08:34:36.625870Z","submitted_at":"2024-12-02T00:38:57Z","title":"AI Benchmarks and Datasets for LLM Evaluation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2412.01020."}