{"as_of":"2026-08-12T19:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d367d70e4fd038cb47cda1572e424850a41afa792dcd50153cfe1bb49a77ea25","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":121,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":121,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":349,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:53:58.655265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":16,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-12T00:51:10.919818Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2211.05100"},"observation_digest":"sha256:7fc77beb8570fc5b235f8f838e942fe10800619f37b0bb74aeae486a81146941","observation_id":"2a2e31f5-aeec-4826-b78d-e5c493f93d40","resolution":{"observed_at":"2026-05-12T00:51:11.310415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-05-12T00:51:10.919818Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2211.05100"},"observation_digest":"sha256:27a4be33c2d6690fc264a9641543bbd995cd42b1972209a85d9f74aaa588638d","observation_id":"21df8cda-88d8-46fd-8b46-d991c83a6b65","resolution":{"observed_at":"2026-05-12T00:51:11.617142Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:27dbd6171a232cafde846bbb8083bc23a148c294cecc302577f1fc2bc7213a70","observation_id":"b857d7ae-e7a1-4bad-b72b-3dc02cf82a60","resolution":{"observed_at":"2026-05-13T23:19:46.406429Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:f4ff59b5b1e26a1ae7d32f4540028e5de43a735d2d23ccfe160d04ee5d389865","observation_id":"71fd7756-0d77-4e79-98c8-079e786055e0","resolution":{"observed_at":"2026-05-16T10:03:59.393937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2305.04388","last_updated":"2023-12-09T21:25:02Z","snapshot_observed_at":"2026-08-12T18:05:02.292342Z","submitted_at":"2023-05-07T22:44:25Z","title":"Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2305.04388"},"observation_digest":"sha256:1bac83c7124a5ae2b5913f4c4c12f328f6c205b38215be8e25f4238b24ac66af","observation_id":"109acafb-4654-4b97-ade5-b7d1d0f50f30","resolution":{"observed_at":"2026-05-15T12:01:19.833619Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:eeb7cc855befa51ea320d8ce2ddefa5c22198ffc418e6c44a8bd7fccef9313d4","observation_id":"284311c4-f8f7-4c9e-9863-d59a231203bf","resolution":{"observed_at":"2026-05-10T23:33:01.097348Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2305.09617","last_updated":"2023-05-16T17:11:29Z","snapshot_observed_at":"2026-08-03T08:52:05.725675Z","submitted_at":"2023-05-16T17:11:29Z","title":"Towards Expert-Level Medical Question Answering with Large Language Models","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-24T04:32:33.271634Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2305.09617"},"observation_digest":"sha256:4908db48e2437062e6cb2ef3d3df6d6219a9cd0b6adecacc45ff19a6520b1e52","observation_id":"2fac3c34-f5b5-44a0-95d9-1cfb280ef061","resolution":{"observed_at":"2026-05-24T04:32:33.596042Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-12T11:59:25.813128Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2305.10403"},"observation_digest":"sha256:62c025ad0f9099eb4da7606f4d40e16d05f15ff2ff84d6843f673a293a188b70","observation_id":"ccaf4683-caab-4354-85e0-1b4d6528f6c1","resolution":{"observed_at":"2026-05-12T11:59:27.187433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T13:29:53.345251Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2305.14314"},"observation_digest":"sha256:16099aceac7a895c26e14e9fad439478b67f64831ade194d487a73050aee0f29","observation_id":"3114b01c-f1c7-4dac-b5ad-6c9c791af106","resolution":{"observed_at":"2026-05-11T13:29:53.548060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-08-08T06:18:27.640980Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:40cf534f1d3861c60b10cecbabc9686a29eef603d02ae521b5d2c39ca1fd0fa7","observation_id":"c50b9ac0-713b-4088-a30b-8a22fa424d79","resolution":{"observed_at":"2026-05-18T01:35:21.244425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:59.033645Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2306.05685"},"observation_digest":"sha256:992642edb618cc5484dead757d50676b9ee88fee5837b48038e360b86cec79f0","observation_id":"4c4b2457-6247-403d-a0b9-40662455db54","resolution":{"observed_at":"2026-05-10T18:52:59.095035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:d093461eb289fd7c15467690c7da67779e4d1178db5f83728de6f13a2abffd71","observation_id":"e7f06c6e-425d-4089-b4da-5e359e40c414","resolution":{"observed_at":"2026-05-17T18:00:50.427058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T22:30:44.520703Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2308.05374"},"observation_digest":"sha256:75ee8902a624fa1d0920094f440d389bb74f6fd81e41dd7c7ba01e303d46868b","observation_id":"4db573e6-6781-430a-b62c-0d42808378ed","resolution":{"observed_at":"2026-05-17T22:30:44.671076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-08-11T05:56:00.837968Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-12T15:46:03.247029Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2311.12983"},"observation_digest":"sha256:262eedd281b275ecbaf269c62b359c7b1730816d3020030ac180ce925f02d44d","observation_id":"2276c250-7782-4a1b-9da1-8fc07679cd7c","resolution":{"observed_at":"2026-05-12T15:46:03.400665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":212,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:93d50dfb167b53757115bae24bef7659e250e0c1f3342f8f4f1a5da60e86e720","observation_id":"f3811a93-4e13-4ad1-945e-4db5cd664d97","resolution":{"observed_at":"2026-05-16T09:46:09.906965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T11:17:08.108565Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2401.05561"},"observation_digest":"sha256:e595cfa279ae21dd7338da93ba0c7fb00ee1841b72aa3f4fb851495ce7044df5","observation_id":"dacd4082-fada-42c9-bcd6-eccb45ff3db4","resolution":{"observed_at":"2026-05-18T11:17:08.428332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-17T23:04:44.287660Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2402.13228"},"observation_digest":"sha256:e7ed9f6b0281c1a19d75d0fd5cf94fb446664d164061ef116761f9927662c8a4","observation_id":"24054ef2-9599-4b38-be4d-b42b0b32f8c9","resolution":{"observed_at":"2026-05-17T23:04:44.477071Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T15:51:04.674346Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2406.01574"},"observation_digest":"sha256:8c67b414e169814c149e3651d0cf82520231d6611cf4959840429653898dd006","observation_id":"8a3635d8-5b20-4c17-9a12-330413744d0b","resolution":{"observed_at":"2026-05-11T15:51:08.467354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2406.11939"},"observation_digest":"sha256:66e2f63b6ac2a0b90c883e604990ee923b9d5d01d1badf8bbabe67d44aeebb08","observation_id":"ca8c94d0-bb92-4d0e-ba17-fd0a9cad37e2","resolution":{"observed_at":"2026-05-24T00:03:38.982197Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2409.00084","last_updated":"2024-09-04T08:22:28Z","snapshot_observed_at":"2026-08-02T15:53:32.867922Z","submitted_at":"2024-08-25T14:50:47Z","title":"Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T22:15:52.638622Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2409.00084"},"observation_digest":"sha256:deebcd57e8554d28baf46c95f989eeb9b4cfc29ec88292ee96c5fb4dd7399275","observation_id":"d4b8d1bf-352d-402b-b588-85accc1e953a","resolution":{"observed_at":"2026-05-23T22:18:31.890032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T18:53:58.655265Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11217","last_updated":"2024-11-18T01:06:12Z","snapshot_observed_at":"2026-08-12T18:44:49.568143Z","submitted_at":"2024-11-18T01:06:12Z","title":"MoE-Lightning: High-Throughput MoE Inference on Memory-constrained GPUs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:53:58.655265Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.11217"},"observation_digest":"sha256:e49d5d473773e48981b3b677aca8b523db7ddf12ece4d5e3c1928c8550b71683","observation_id":"854a1e9f-aa4b-4011-9d9e-4a05206611dc","resolution":{"observed_at":"2026-08-12T18:53:58.655265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T17:15:21.919619Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12709","last_updated":"2024-11-19T18:25:30Z","snapshot_observed_at":"2026-08-12T17:11:23.009862Z","submitted_at":"2024-11-19T18:25:30Z","title":"Dimensions of Generative AI Evaluation Design","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:15:21.919619Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.12709"},"observation_digest":"sha256:b0ef31b57c7d3a23a51ed7f6b71656b1c4c3f8de3f22038e4c74fa51a6a4473e","observation_id":"6effd4b1-d362-43ff-9d01-695d8a0137ea","resolution":{"observed_at":"2026-08-12T17:15:21.919619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T15:54:33.121732Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13808","last_updated":"2024-11-21T03:14:31Z","snapshot_observed_at":"2026-08-12T15:49:16.815127Z","submitted_at":"2024-11-21T03:14:31Z","title":"GPAI Evaluations Standards Taskforce: Towards Effective AI Governance","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:54:33.121732Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.13808"},"observation_digest":"sha256:ecaa9ec3b3da713444b01ecba00cd182c648fe8e769f2c8131a16caefa97dad5","observation_id":"c4e1c07a-6472-4e33-8bce-b595859eb664","resolution":{"observed_at":"2026-08-12T15:54:33.121732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T16:56:44.738374Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14487","last_updated":"2024-11-20T06:34:32Z","snapshot_observed_at":"2026-08-12T16:49:59.294121Z","submitted_at":"2024-11-20T06:34:32Z","title":"Ensuring Safety and Trust: Analyzing the Risks of Large Language Models in Medicine","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:44.738374Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.14487"},"observation_digest":"sha256:29a988ab57d81ed576d97b9697711800f0be639bb881c9bb99df1ffe426ef387","observation_id":"27f63275-d104-41ff-9613-56c2c419aae4","resolution":{"observed_at":"2026-08-12T16:56:44.738374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T14:29:54.226325Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15320","last_updated":"2024-11-22T19:28:06Z","snapshot_observed_at":"2026-08-12T14:23:39.254918Z","submitted_at":"2024-11-22T19:28:06Z","title":"PPLqa: An Unsupervised Information-Theoretic Quality Metric for Comparing Generative Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T14:29:54.226325Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.15320"},"observation_digest":"sha256:c59c0a372cd025dd58977dfff257af121876928060c1164486ef9c067f8f1351","observation_id":"45e17965-2ffe-431c-bd3b-2ba97c179f1d","resolution":{"observed_at":"2026-08-12T14:29:54.226325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T14:27:57.413062Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15387","last_updated":"2024-12-11T23:00:55Z","snapshot_observed_at":"2026-08-12T14:19:25.090449Z","submitted_at":"2024-11-23T00:02:21Z","title":"From Jack of All Trades to Master of One: Specializing LLM-based Autoraters to a Test Set","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T14:27:57.413062Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.15387"},"observation_digest":"sha256:c266449363fe3d1bebbc06d11cb7bd04dbf20edfacba85000615428848f0fe06","observation_id":"dbf6de75-1d22-4c99-acec-3c2b57599080","resolution":{"observed_at":"2026-08-12T14:27:57.413062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T13:27:06.690101Z","title":"https://github.com/XuanwuAI/SecEval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.690101Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:a6e3442f5fe72fabee63e79a7d9878c50068294eaf368d6131d7cdd1f3f6270d","observation_id":"38462fc9-d789-48ce-8a39-a724681605a7","resolution":{"observed_at":"2026-08-12T13:27:06.690101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T12:28:14.337637Z","title":", author Bommasani, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17204","last_updated":"2024-11-28T01:04:40Z","snapshot_observed_at":"2026-08-12T18:21:48.089006Z","submitted_at":"2024-11-26T08:21:24Z","title":"Strategic Prompting for Conversational Tasks: A Comparative Analysis of Large Language Models Across Diverse Conversational Tasks","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T12:28:14.337637Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.17204"},"observation_digest":"sha256:c0019a1d8edd24996d22717a9ee800b1cff63680eaa2022505b5fd0b73e1136e","observation_id":"e4b60683-06f7-44b2-9629-5734beb4a3c3","resolution":{"observed_at":"2026-08-12T12:28:14.337637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T12:21:33.895762Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17338","last_updated":"2024-11-26T11:32:43Z","snapshot_observed_at":"2026-08-12T12:11:10.751234Z","submitted_at":"2024-11-26T11:32:43Z","title":"Different Bias Under Different Criteria: Assessing Bias in LLMs with a Fact-Based Approach","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:21:33.895762Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.17338"},"observation_digest":"sha256:72e6b53bc88d3987c90eac270a0dffdbe4ccc141dec69fcff00211c9d4573ac3","observation_id":"7ffce77d-4554-48c2-b7a0-00122bd02305","resolution":{"observed_at":"2026-08-12T12:21:33.895762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T05:33:56.136541Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00353","last_updated":"2024-12-06T10:24:47Z","snapshot_observed_at":"2026-08-12T05:25:46.961315Z","submitted_at":"2024-11-30T04:22:00Z","title":"Enhancing Zero-shot Chain of Thought Prompting via Uncertainty-Guided Strategy Selection","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T05:33:56.136541Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.00353"},"observation_digest":"sha256:5a034a543915fd43f20da18c17fa1b23940ec8146213fcde65967c62cb17db11","observation_id":"4e7290a1-7f3f-4dad-81a5-8aaeb574c22d","resolution":{"observed_at":"2026-08-12T05:33:56.136541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T05:21:55.117620Z","title":"arXiv preprint arXiv:2211.09110 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00546","last_updated":"2024-11-30T17:39:59Z","snapshot_observed_at":"2026-08-12T17:25:59.671054Z","submitted_at":"2024-11-30T17:39:59Z","title":"Rank It, Then Ask It: Input Reranking for Maximizing the Performance of LLMs on Symmetric Tasks","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T05:21:55.117620Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.00546"},"observation_digest":"sha256:2c0e30e4db83bb84782498e3b95fcf97d8578c7c1332fbd473d41ed2056bc53e","observation_id":"63c82884-8e57-4f5a-8d98-b09919060252","resolution":{"observed_at":"2026-08-12T05:21:55.117620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T05:18:55.812296Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00554","last_updated":"2024-12-07T19:00:45Z","snapshot_observed_at":"2026-08-12T17:25:32.236835Z","submitted_at":"2024-11-30T18:52:30Z","title":"Unveiling Performance Challenges of Large Language Models in Low-Resource Healthcare: A Demographic Fairness Perspective","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T05:18:55.812296Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.00554"},"observation_digest":"sha256:f3b8f556e352586c5f0c9ec44c6dced9c3ee3d41c82f87c63cbb28186b8be50a","observation_id":"33d99f40-47cc-4c61-aea0-6812515a4d73","resolution":{"observed_at":"2026-08-12T05:18:55.812296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T04:35:59.502032Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01233","last_updated":"2024-12-02T07:54:55Z","snapshot_observed_at":"2026-08-12T18:59:45.660241Z","submitted_at":"2024-12-02T07:54:55Z","title":"Best Practices for Large Language Models in Radiology","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T04:35:59.502032Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.01233"},"observation_digest":"sha256:1e31ce24fe78b021b0cd3779a57126bf4457baf8d69be58e892db54f9655b524","observation_id":"627e066d-cf78-46da-beef-dbc4afd38e81","resolution":{"observed_at":"2026-08-12T04:35:59.502032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T04:20:21.483043Z","title":"Holistic Evaluation of Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01526","last_updated":"2024-12-02T14:18:32Z","snapshot_observed_at":"2026-08-12T18:25:11.618927Z","submitted_at":"2024-12-02T14:18:32Z","title":"Addressing Data Leakage in HumanEval Using Combinatorial Test Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:20:21.483043Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.01526"},"observation_digest":"sha256:f8187751b0aa9a819ef4e109ad1bfc35d5235826844596174b171e5a34a77035","observation_id":"ffd2df8d-b59f-4695-9cc1-eb5b565deece","resolution":{"observed_at":"2026-08-12T04:20:21.483043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T04:22:02.813497Z","title":"Holistic evalu- ation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01528","last_updated":"2025-08-21T05:56:47Z","snapshot_observed_at":"2026-08-12T10:14:08.527630Z","submitted_at":"2024-12-02T14:19:44Z","title":"CopyrightShield: Enhancing Diffusion Model Security against Copyright Infringement Attacks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:22:02.813497Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.01528"},"observation_digest":"sha256:dba2610fed3e449eab6f926902fb0d0969bdbfe5630ea8ce861fe0af46a24fa6","observation_id":"dc408e55-2172-4b16-ae57-05e086bfd276","resolution":{"observed_at":"2026-08-12T04:22:02.813497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T22:06:51.303089Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03822","last_updated":"2024-12-05T02:35:46Z","snapshot_observed_at":"2026-08-12T06:33:00.926239Z","submitted_at":"2024-12-05T02:35:46Z","title":"Beyond the Binary: Capturing Diverse Preferences With Reward Regularization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:51.303089Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.03822"},"observation_digest":"sha256:6c6dfd10be285891a992b0df4532f0fd91752317765ad28323b5f2c2775a8ba8","observation_id":"396228b2-8607-415e-a327-5bec2dd767af","resolution":{"observed_at":"2026-08-11T22:06:51.303089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T21:10:35.151341Z","title":"InProceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, EMNLP 2023 - System Demonstrations, Singapore, December 6-10, 2023, pages 186–217","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04947","last_updated":"2025-05-29T05:29:28Z","snapshot_observed_at":"2026-08-12T01:40:30.259470Z","submitted_at":"2024-12-06T11:07:44Z","title":"C$^2$LEVA: Toward Comprehensive and Contamination-Free Language Model Evaluation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:10:35.151341Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.04947"},"observation_digest":"sha256:43e823930154cebe6ecbf5c63f702b7181398660871a2438b0397ed9294f73b3","observation_id":"496bbc29-aa5d-4013-9cc9-e5810ee50300","resolution":{"observed_at":"2026-08-11T21:10:35.151341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T18:03:57.173433Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08291","last_updated":"2024-12-11T11:07:50Z","snapshot_observed_at":"2026-08-12T01:44:43.382276Z","submitted_at":"2024-12-11T11:07:50Z","title":"Code LLMs: A Taxonomy-based Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:57.173433Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.08291"},"observation_digest":"sha256:4851dee1f0e9bb5fa7b135e12d0a1b360e4a6233ffbcb847bd447f0988fbb1c2","observation_id":"c29116bd-d715-461e-bc48-61ca2bbfff9a","resolution":{"observed_at":"2026-08-11T18:03:57.173433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T18:03:22.759469Z","title":"BLIP-2: bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-11T23:49:33.490892Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.759469Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:8807b47adaee85f9385e2f29e163c3cd0ee4300f1d2914c8d06f3926fed49fdb","observation_id":"bd859e7b-4303-43e9-85be-3d014470063d","resolution":{"observed_at":"2026-08-11T18:03:22.759469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T17:19:21.846142Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09173","last_updated":"2024-12-12T11:03:25Z","snapshot_observed_at":"2026-08-12T10:23:56.015788Z","submitted_at":"2024-12-12T11:03:25Z","title":"ReFF: Reinforcing Format Faithfulness in Language Models across Varied Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:19:21.846142Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.09173"},"observation_digest":"sha256:ae0f4369207758fc3dab4ff461011caa352c51b2cdb97faad6aa69870655fe26","observation_id":"84169d9f-473d-4b0e-ae81-120693f2d837","resolution":{"observed_at":"2026-08-11T17:19:21.846142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T15:02:33.258973Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11414","last_updated":"2024-12-16T03:29:08Z","snapshot_observed_at":"2026-08-11T14:55:37.118416Z","submitted_at":"2024-12-16T03:29:08Z","title":"Biased or Flawed? Mitigating Stereotypes in Generative Language Models by Addressing Task-Specific Flaws","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:02:33.258973Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.11414"},"observation_digest":"sha256:fee32938ec1ca75745bb3fb5681458a6759a6f59b22a66b6d1022e5e13fb3698","observation_id":"3f8c4ce8-bd46-455b-b93b-5700c83e709a","resolution":{"observed_at":"2026-08-11T15:02:33.258973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T17:29:02.773849Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12170","last_updated":"2024-12-12T06:27:12Z","snapshot_observed_at":"2026-08-11T17:19:05.809922Z","submitted_at":"2024-12-12T06:27:12Z","title":"PickLLM: Context-Aware RL-Assisted Large Language Model Routing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:29:02.773849Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.12170"},"observation_digest":"sha256:1120b3f55caeca5ba14b6854c07283e5d3732068ac4d9d0cb671c2a9136f9ed1","observation_id":"add45c71-8f27-4ea8-87d5-bd84b9256717","resolution":{"observed_at":"2026-08-11T17:29:02.773849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T12:58:26.892141Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13666","last_updated":"2025-07-25T06:20:38Z","snapshot_observed_at":"2026-08-12T07:18:12.780142Z","submitted_at":"2024-12-18T09:48:53Z","title":"Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T12:58:26.892141Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.13666"},"observation_digest":"sha256:6710ea57093683671daa45b15feefae6502c779f62db74e58fb1fabbe329e077","observation_id":"bcdbf6ba-05ba-469f-aa78-396ca4958c90","resolution":{"observed_at":"2026-08-11T12:58:26.892141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T12:09:29.199485Z","title":"u ksekg \\","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14574","last_updated":"2024-12-19T06:44:59Z","snapshot_observed_at":"2026-08-12T01:28:03.724754Z","submitted_at":"2024-12-19T06:44:59Z","title":"Sliding Windows Are Not the End: Exploring Full Ranking with Long-Context Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T12:09:29.199485Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.14574"},"observation_digest":"sha256:ba2bc4b376dcb7325587f594ef2857248f7ae402bb7037df93b1c2ec3f6375b9","observation_id":"9f689af3-fa83-48a2-b8ad-cb04e59ac950","resolution":{"observed_at":"2026-08-11T12:09:29.199485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T23:48:02.339502Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01973","last_updated":"2025-01-09T07:26:05Z","snapshot_observed_at":"2026-08-10T23:40:36.197059Z","submitted_at":"2024-12-28T02:28:19Z","title":"INFELM: In-depth Fairness Evaluation of Large Text-To-Image Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:48:02.339502Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.01973"},"observation_digest":"sha256:39a765e80205b9ee39cb0bc5e062715c2c05e751006636961ec90e4fdb9e2b3c","observation_id":"aaf64c9c-8a63-44e6-abab-2941bf075d34","resolution":{"observed_at":"2026-08-10T23:48:02.339502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T21:56:29.802738Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03112","last_updated":"2025-01-06T16:20:44Z","snapshot_observed_at":"2026-08-12T15:58:59.479755Z","submitted_at":"2025-01-06T16:20:44Z","title":"LangFair: A Python Package for Assessing Bias and Fairness in Large Language Model Use Cases","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T21:56:29.802738Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.03112"},"observation_digest":"sha256:420af03d731e74fb7404954d1ef72d1413d9565a62d4465bf7bce5a489bfa481","observation_id":"f7e3189a-48ed-4eda-8eb0-f730cbd65023","resolution":{"observed_at":"2026-08-10T21:56:29.802738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T16:32:07.811499Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04008","last_updated":"2025-03-16T21:12:51Z","snapshot_observed_at":"2026-08-11T16:26:01.058940Z","submitted_at":"2024-12-13T09:26:04Z","title":"A Generative AI-driven Metadata Modelling Approach","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T16:32:07.811499Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.04008"},"observation_digest":"sha256:64e71efb9ab654b90446af21273a92970b710f5e9b4ae31ca6575c9b91aa358e","observation_id":"24d4414f-df42-44b7-8b4f-fe720994635c","resolution":{"observed_at":"2026-08-11T16:32:07.811499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T22:17:56.116010Z","title":"Holistic Evaluation of Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04040","last_updated":"2025-02-09T08:00:36Z","snapshot_observed_at":"2026-08-10T22:47:31.199700Z","submitted_at":"2025-01-03T21:04:49Z","title":"A Survey on Large Language Models with some Insights on their Capabilities and Limitations","version":2},"reference_index":190,"source":"pdf_text","source_observed_at":"2026-08-10T22:17:56.116010Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.04040"},"observation_digest":"sha256:049dabfc44742e807d92ba8ac28e7f3eeab7c75af4df480757df473dde16e56a","observation_id":"11554f1f-f4e1-40dc-bc36-013fbacd976d","resolution":{"observed_at":"2026-08-10T22:17:56.116010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T20:53:59.736259Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07071","last_updated":"2025-06-02T15:40:42Z","snapshot_observed_at":"2026-08-12T00:45:41.935460Z","submitted_at":"2025-01-13T05:53:56Z","title":"Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:53:59.736259Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.07071"},"observation_digest":"sha256:461e1d337f6b0981d7cb83d35131d65c5661df26f84f582084af5ab826fe5bda","observation_id":"9d6439d2-e77b-4d61-a9ac-b786c99d9dec","resolution":{"observed_at":"2026-08-10T20:53:59.736259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T20:34:34.841850Z","title":"Holistic Evaluation of Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08262","last_updated":"2025-01-14T17:21:16Z","snapshot_observed_at":"2026-08-12T12:12:48.696575Z","submitted_at":"2025-01-14T17:21:16Z","title":"Addressing the sustainable AI trilemma: a case study on LLM agents and RAG","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:34:34.841850Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.08262"},"observation_digest":"sha256:7a842a8b0797e34e19111f12cf08718c11a5c1ae46922894dfadff2e3b2e525f","observation_id":"32469f6b-cb2d-49f3-b768-e031bb9cdc87","resolution":{"observed_at":"2026-08-10T20:34:34.841850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T15:39:33.230512Z","title":"Liang, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13802","last_updated":"2025-03-09T16:39:06Z","snapshot_observed_at":"2026-08-12T01:14:05.363130Z","submitted_at":"2025-01-23T16:21:15Z","title":"Enhancing LLMs for Governance with Human Oversight: Evaluating and Aligning LLMs on Expert Classification of Climate Misinformation for Detecting False or Misleading Claims about Climate Change","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:39:33.230512Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2501.13802"},"observation_digest":"sha256:5f0f4e4a1405308661762ed3466e978778ac913c38591558acb0ccc4af20f14f","observation_id":"9f47109e-10b6-477e-b1cf-8a0cc5bbacf4","resolution":{"observed_at":"2026-08-10T15:39:33.230512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2502.00709","last_updated":"2026-04-16T23:58:55Z","snapshot_observed_at":"2026-08-03T02:52:29.636832Z","submitted_at":"2025-02-02T07:49:56Z","title":"RankFlow: A Multi-Role Collaborative Reranking Workflow Utilizing Large Language Models","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T04:36:32.897387Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.00709"},"observation_digest":"sha256:4572f01a02707c0d3fe02d88ae15fc12b035fba73717be932b10bf06ed832ecd","observation_id":"5d7cc790-2d6c-4439-912f-fb955a6bec0b","resolution":{"observed_at":"2026-05-23T04:37:31.933903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-09T16:34:01.122641Z","title":"Narayanan, Yuhuai Wu, Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan, Ce Zhang, Christian Cosgrove, Christopher D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.122641Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:d9ccef81cb1ec496b32b4a9fdb8baa17ac28b2813890753d60a394d64a4de20a","observation_id":"06999197-03dc-4598-b2eb-405ce3fdcf68","resolution":{"observed_at":"2026-08-09T16:34:01.122641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-09T11:22:28.913059Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02743","last_updated":"2025-02-04T22:09:43Z","snapshot_observed_at":"2026-08-12T12:43:57.543349Z","submitted_at":"2025-02-04T22:09:43Z","title":"LLM Bandit: Cost-Efficient LLM Generation via Preference-Conditioned Dynamic Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T11:22:28.913059Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.02743"},"observation_digest":"sha256:bc7c0d467c7257461c5eef9ad9910890f2d83da4b55e5e9c555b1517a18352ed","observation_id":"e6887e6a-0877-46d1-8f8a-f439804b5877","resolution":{"observed_at":"2026-08-09T11:22:28.913059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T20:51:52.861137Z","title":"Holistic evaluation of langu age models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03472","last_updated":"2025-01-12T16:20:40Z","snapshot_observed_at":"2026-08-12T07:42:14.103912Z","submitted_at":"2025-01-12T16:20:40Z","title":"Powering LLM Regulation through Data: Bridging the Gap from Compute Thresholds to Customer Experiences","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:51:52.861137Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.03472"},"observation_digest":"sha256:d40ac156b106313ed72af9fd45789a7fa9b7175168d741b1cefc2ac8e546ffc2","observation_id":"706c8388-aaf6-4f52-ad7d-565da31aaef2","resolution":{"observed_at":"2026-08-10T20:51:52.861137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-09T01:05:23.072022Z","title":"arXiv:2211.09110","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03711","last_updated":"2025-02-06T01:58:48Z","snapshot_observed_at":"2026-08-11T13:29:23.776040Z","submitted_at":"2025-02-06T01:58:48Z","title":"MultiQ&A: An Analysis in Measuring Robustness via Automated Crowdsourcing of Question Perturbations and Answers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T01:05:23.072022Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.03711"},"observation_digest":"sha256:9250bde4f0716a5657ef2024f93f20f2cb8d12044435a3be1f42fe6de8b06f51","observation_id":"651ef3b7-6b2e-4988-ad39-5486161d1280","resolution":{"observed_at":"2026-08-09T01:05:23.072022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T15:06:55.036681Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06559","last_updated":"2025-05-25T23:36:47Z","snapshot_observed_at":"2026-08-08T23:28:10.897343Z","submitted_at":"2025-02-10T15:25:06Z","title":"Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T15:06:55.036681Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.06559"},"observation_digest":"sha256:71ec5cd84341b69015af9b79584442094e43de0204d189d17b703eb68b08e811","observation_id":"f7e73f1a-be3b-4574-869d-ebff3a8d7aaa","resolution":{"observed_at":"2026-08-08T15:06:55.036681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T14:51:15.426227Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06655","last_updated":"2025-05-12T14:34:05Z","snapshot_observed_at":"2026-08-11T12:35:53.835974Z","submitted_at":"2025-02-10T16:45:18Z","title":"Unbiased Evaluation of Large Language Models from a Causal Perspective","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T14:51:15.426227Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.06655"},"observation_digest":"sha256:a4868c43949b8beaae824f9c687c6346caed1b2fd96d97b2e69e60ca86852d3d","observation_id":"eaeada13-0cc4-4762-9209-69f34cdc99f6","resolution":{"observed_at":"2026-08-08T14:51:15.426227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T19:15:25.382826Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06872","last_updated":"2025-02-08T06:50:47Z","snapshot_observed_at":"2026-08-08T19:10:42.419238Z","submitted_at":"2025-02-08T06:50:47Z","title":"Towards Trustworthy Retrieval Augmented Generation for Large Language Models: A Survey","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:25.382826Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.06872"},"observation_digest":"sha256:a342cf8d0699f9a27ab662fbe611806302a5e942f2aa1fc5a03fb8f57861b8cd","observation_id":"e1aac824-a3ea-4db0-b811-de8ebc76936e","resolution":{"observed_at":"2026-08-08T19:15:25.382826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T13:10:56.377693Z","title":"arXiv:arXiv :2211.09110","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07315","last_updated":"2025-02-23T09:44:00Z","snapshot_observed_at":"2026-08-11T17:38:26.145083Z","submitted_at":"2025-02-11T07:25:57Z","title":"White Hat Search Engine Optimization using Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T13:10:56.377693Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.07315"},"observation_digest":"sha256:af82d35f80f58aceff63e45734e479792d0b461748826514ed15d8addae22bf5","observation_id":"ce47f047-a3fb-4c34-a689-8de137f31e16","resolution":{"observed_at":"2026-08-08T13:10:56.377693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T11:44:59.733056Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07747","last_updated":"2025-02-11T18:14:44Z","snapshot_observed_at":"2026-08-09T02:46:07.194163Z","submitted_at":"2025-02-11T18:14:44Z","title":"WHODUNIT: Evaluation benchmark for culprit detection in mystery stories","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T11:44:59.733056Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.07747"},"observation_digest":"sha256:1fb5111a71d34f4db603fdfcbf3800e93f387ae99dd8bf32f7101f1c9788d218","observation_id":"6ccb9e5d-77dc-4605-97b2-3ff4ae39264b","resolution":{"observed_at":"2026-08-08T11:44:59.733056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T04:58:33.096413Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08489","last_updated":"2025-02-13T17:33:24Z","snapshot_observed_at":"2026-08-10T11:23:02.731143Z","submitted_at":"2025-02-12T15:26:08Z","title":"Salamandra Technical Report","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-08T04:58:33.096413Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.08489"},"observation_digest":"sha256:14335fd175d1ab3a06e63314ddd08ebf7587624a7e15f71bbc6468da607fe380","observation_id":"29d6a1a3-2b5b-4296-9a88-b5697a9071e9","resolution":{"observed_at":"2026-08-08T04:58:33.096413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T04:54:50.768611Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-09T13:56:26.887562Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.768611Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2c0d0b8e30f6f5252fe90e9f6027372d30830cf2cceda30b6b03d26839e08219","observation_id":"08eb5c24-8535-4b84-8652-abfed5201ad3","resolution":{"observed_at":"2026-08-08T04:54:50.768611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T23:35:42.752311Z","title":"Manning, Christo- pher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.752311Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:09a08797f5570c0e942f1ac8800deef5583a74c48b818bf56026b490d43c4267","observation_id":"88eb5930-81a1-40fd-bdd6-eebf5bcb7c84","resolution":{"observed_at":"2026-08-07T23:35:42.752311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T19:19:38.204950Z","title":"In Proceedings of the International Confer- enceRecentAdvancesinNaturalLanguageProcess- ing,pages249–257,Hissar,Bulgaria.INCOMALtd","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10140","last_updated":"2025-02-14T13:10:39Z","snapshot_observed_at":"2026-08-09T18:51:41.328606Z","submitted_at":"2025-02-14T13:10:39Z","title":"Small Models, Big Impact: Efficient Corpus and Graph-Based Adaptation of Small Multilingual Language Models for Low-Resource Languages","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T19:19:38.204950Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.10140"},"observation_digest":"sha256:1241f84cd621763b23c5ca03f2e472123f16b9c1c18f87ae1e5dd22a63b5678c","observation_id":"298370d4-fe6e-481a-ae59-4f4ed00a8fd4","resolution":{"observed_at":"2026-08-07T19:19:38.204950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-10T10:07:33.771199Z","title":"”Holistic Evaluation of Language Models.” arXiv preprint arXiv:2211.09110 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15724","last_updated":"2025-01-28T11:34:22Z","snapshot_observed_at":"2026-08-12T07:17:56.207172Z","submitted_at":"2025-01-28T11:34:22Z","title":"Instruction-Based Fine-tuning of Open-Source LLMs for Predicting Customer Purchase Behaviors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T10:07:33.771199Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.15724"},"observation_digest":"sha256:cf0b07feb1c3521f810885e38045e0598a0263b9c1a55066a3349f98e44e9a2c","observation_id":"53288b3d-354a-46b5-91bd-77643a3ce62d","resolution":{"observed_at":"2026-08-10T10:07:33.771199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"reference_index":169,"source":"arxiv_source","source_observed_at":"2026-05-11T13:02:43.571234Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.18864"},"observation_digest":"sha256:ecd571cd2ef20b8c13ed634e5f7499a6983d410fba81609ca5b1168d7be65626","observation_id":"7004c954-9449-48ce-8b1e-ba9edb649fcd","resolution":{"observed_at":"2026-05-11T13:02:45.077542Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2503.16771","last_updated":"2026-04-12T13:23:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T01:00:45Z","title":"Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T23:41:22.017848Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2503.16771"},"observation_digest":"sha256:53e8a3cd56d31cca5acce4c9d5abab0dce19d648de2870af9a77ff85088cd476","observation_id":"f0bcf5e2-1a4f-4abd-9852-fb73ae166fe1","resolution":{"observed_at":"2026-05-22T23:42:16.115559Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2504.16155","last_updated":"2026-05-07T09:59:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:52:04Z","title":"PRIMETIME : Limits of LLMs in Temporal Primitives","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-22T18:36:48.376877Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2504.16155"},"observation_digest":"sha256:10d5dfc5d82b5dff5766b1377034a38e17d8d03430693ac7432c3c87e3277e2a","observation_id":"17351bac-c664-4485-a0ae-67855d85dc35","resolution":{"observed_at":"2026-05-22T18:36:58.792994Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2505.12601","last_updated":"2026-05-14T18:08:42Z","snapshot_observed_at":"2026-08-02T11:09:30.375825Z","submitted_at":"2025-05-19T01:33:41Z","title":"Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T15:13:28.927880Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.12601"},"observation_digest":"sha256:37779bdfcb8be00885dba9e058ae903512cc90e8eac5f604b8b68da17c638ae4","observation_id":"7185838f-adde-4da3-89d5-65093b10910a","resolution":{"observed_at":"2026-05-22T15:14:57.484055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2505.15323","last_updated":"2026-04-03T14:23:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T09:58:38Z","title":"Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T14:21:18.355360Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.15323"},"observation_digest":"sha256:96a1a4fda6a9a391989f9533dfdf2ea98d6c5af51ba71554397d22bfd4bc87a3","observation_id":"0f962621-e721-4d8a-8038-118360d4715b","resolution":{"observed_at":"2026-05-22T14:21:39.613433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T15:12:13.198498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16128","last_updated":"2025-05-25T02:52:06Z","snapshot_observed_at":"2026-08-11T10:24:50.181357Z","submitted_at":"2025-05-22T02:13:48Z","title":"Veracity Bias and Beyond: Uncovering LLMs' Hidden Beliefs in Problem-Solving Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:12:13.198498Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.16128"},"observation_digest":"sha256:bdbdb542770dc9e9371f73caa2ba922918e8360c4d1652d6e93131a0e7a6a599","observation_id":"0167f08b-7e13-4d3f-a7c7-7424af1f6053","resolution":{"observed_at":"2026-08-07T15:12:13.198498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T15:07:00.526886Z","title":"Liang, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16276","last_updated":"2025-05-22T06:21:40Z","snapshot_observed_at":"2026-08-07T21:21:10.537298Z","submitted_at":"2025-05-22T06:21:40Z","title":"How do Scaling Laws Apply to Knowledge Graph Engineering Tasks? The Impact of Model Size on Large Language Model Performance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:00.526886Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.16276"},"observation_digest":"sha256:f1fdca4af0eac6b656af626b0a683889f877cd31b2748d7855add9dd4b989878","observation_id":"18a23f07-3b2a-4d2d-82e2-b3b24dd28cf7","resolution":{"observed_at":"2026-08-07T15:07:00.526886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T15:12:22.022328Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17131","last_updated":"2025-05-22T01:59:54Z","snapshot_observed_at":"2026-08-11T22:11:49.574494Z","submitted_at":"2025-05-22T01:59:54Z","title":"Relative Bias: A Comparative Framework for Quantifying Bias in LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:22.022328Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.17131"},"observation_digest":"sha256:936b085bb00da4c853c039da17ca682d377f17c73a6ffcf3cee3342ee868aa96","observation_id":"9e817d53-75a9-4742-972f-1035cb756a88","resolution":{"observed_at":"2026-08-07T15:12:22.022328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T14:23:34.517834Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19163","last_updated":"2025-05-25T14:22:18Z","snapshot_observed_at":"2026-08-10T09:02:45.298749Z","submitted_at":"2025-05-25T14:22:18Z","title":"SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:34.517834Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.19163"},"observation_digest":"sha256:aa7f820e5b6a5d260360fcfca10f64dde4d6aede97f6990dd949bbba22b537ee","observation_id":"e760b2af-b696-4799-8cb7-c3d8d1e693a6","resolution":{"observed_at":"2026-08-07T14:23:34.517834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T14:07:12.880824Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20046","last_updated":"2025-05-26T14:31:48Z","snapshot_observed_at":"2026-08-08T21:13:42.536838Z","submitted_at":"2025-05-26T14:31:48Z","title":"REARANK: Reasoning Re-ranking Agent via Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:07:12.880824Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.20046"},"observation_digest":"sha256:7d73fb5fc4f909807c37dd6b8495138b41747b2cb5a1c1631bcfc1830bb3098f","observation_id":"2fa802e0-ff55-4d3e-a7f4-23a95b019711","resolution":{"observed_at":"2026-08-07T14:07:12.880824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T13:28:24.704962Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-11T19:16:25.208860Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.704962Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:dedab2fdcbd418469fde15aca101c3dc828e66bd8b6c9cfbbbc09f1384e29091","observation_id":"869f92eb-023a-433b-9a5d-87cc4520c761","resolution":{"observed_at":"2026-08-07T13:28:24.704962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T12:44:06.487420Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23996","last_updated":"2025-05-29T20:45:18Z","snapshot_observed_at":"2026-08-07T21:00:36.726464Z","submitted_at":"2025-05-29T20:45:18Z","title":"Is Your Model Fairly Certain? Uncertainty-Aware Fairness Evaluation for LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:06.487420Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.23996"},"observation_digest":"sha256:cdb60a6f4e16bb40e00d879564b59b9e01a7864135ecec930f35b99505b3f1e5","observation_id":"ed57de1c-10d0-4c87-bbb7-59015f1042b5","resolution":{"observed_at":"2026-08-07T12:44:06.487420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:55:19.678444Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01133","last_updated":"2025-06-01T19:33:21Z","snapshot_observed_at":"2026-08-07T11:48:13.623646Z","submitted_at":"2025-06-01T19:33:21Z","title":"From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:19.678444Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01133"},"observation_digest":"sha256:9416d08ca16979b65ea5a8a46124099f0e52156265b4a7ff724ee42115482f66","observation_id":"651a6269-6e48-46a1-b3f1-48a56e9347e9","resolution":{"observed_at":"2026-08-07T11:55:19.678444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:36:09.881359Z","title":"arXiv preprint arXiv:2211.09110 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01793","last_updated":"2025-06-02T15:33:29Z","snapshot_observed_at":"2026-08-09T17:33:58.508186Z","submitted_at":"2025-06-02T15:33:29Z","title":"Human-Centric Evaluation for Foundation Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.881359Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01793"},"observation_digest":"sha256:17b1085725f8b4525756c2880410194bb1ebf52fce84b210461c3a4a94cbbb07","observation_id":"fcb0f193-1d3f-4d51-bf99-f699c382f548","resolution":{"observed_at":"2026-08-07T11:36:09.881359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:39:46.171747Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01850","last_updated":"2026-06-05T03:03:30Z","snapshot_observed_at":"2026-08-10T02:04:41.178239Z","submitted_at":"2025-06-02T16:38:50Z","title":"MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:46.171747Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.01850"},"observation_digest":"sha256:aa2b52cfc6a74dc6312ee3603fd3a4dd535c937b48f1297d9c1d888977d2e2c4","observation_id":"1ace072c-7f89-43fc-97c8-da9aef52b629","resolution":{"observed_at":"2026-08-07T11:39:46.171747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T11:00:54.811123Z","title":"Holistic evalu- ation of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03709","last_updated":"2025-06-04T08:41:19Z","snapshot_observed_at":"2026-08-09T11:23:24.568374Z","submitted_at":"2025-06-04T08:41:19Z","title":"AetherVision-Bench: An Open-Vocabulary RGB-Infrared Benchmark for Multi-Angle Segmentation across Aerial and Ground Perspectives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:00:54.811123Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.03709"},"observation_digest":"sha256:e1b2cbb05e564b8c7e71e984cc0db987a13a6d8dc28419c623276a6cac754132","observation_id":"734ea006-f8da-425d-8a43-001721b94a15","resolution":{"observed_at":"2026-08-07T11:00:54.811123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T05:54:34.893274Z","title":"Liang, R","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06832","last_updated":"2025-06-22T12:08:32Z","snapshot_observed_at":"2026-08-09T17:01:08.454683Z","submitted_at":"2025-06-07T15:25:10Z","title":"Cross-Entropy Games for Language Models: From Implicit Knowledge to General Capability Measures","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:34.893274Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.06832"},"observation_digest":"sha256:e92dd17e75e6aaf8ae27cc546e5cf47cd27ed4c2ca4ec6b78eb8a5929f216063","observation_id":"a6e7e1dd-fb91-4302-abe1-0fe58aa54d11","resolution":{"observed_at":"2026-08-07T05:54:34.893274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T05:10:37.169704Z","title":"Holistic evaluation of language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08727","last_updated":"2025-06-10T12:23:02Z","snapshot_observed_at":"2026-08-10T20:15:54.404583Z","submitted_at":"2025-06-10T12:23:02Z","title":"Breaking the ICE: Exploring promises and challenges of benchmarks for Inference Carbon & Energy estimation for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:37.169704Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.08727"},"observation_digest":"sha256:d64553ff5e378498a495586e2489a1f57ec9b4c0fb671617b46289c9df4efcfd","observation_id":"0e50d866-5b5a-462c-ba6a-267b6524b1a1","resolution":{"observed_at":"2026-08-07T05:10:37.169704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T05:01:08.034053Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-10T22:41:21.434916Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:08.034053Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.09038"},"observation_digest":"sha256:2dc4aa0c18ad064f2e1e5d70ed0030bdaa6e38aa237b305eb9b779de677ac0b7","observation_id":"a07129ff-b59a-4975-a41d-cda583b50758","resolution":{"observed_at":"2026-08-07T05:01:08.034053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T05:14:43.736114Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09081","last_updated":"2025-07-28T19:31:25Z","snapshot_observed_at":"2026-08-09T21:52:44.527128Z","submitted_at":"2025-06-10T04:19:02Z","title":"FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.736114Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.09081"},"observation_digest":"sha256:c05d17d90c099732650ab1be6453ace9c9c51b63a3427485e509a63756f097b2","observation_id":"4e25f433-5a68-4b69-b0ec-849b35998983","resolution":{"observed_at":"2026-08-07T05:14:43.736114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T04:50:34.163425Z","title":"Holistic evaluation of language models.arXiv preprint arXiv:2211.09110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09813","last_updated":"2025-06-16T12:43:27Z","snapshot_observed_at":"2026-08-09T15:49:24.115627Z","submitted_at":"2025-06-11T14:53:47Z","title":"Metritocracy: Representative Metrics for Lite Benchmarks","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:50:34.163425Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.09813"},"observation_digest":"sha256:81ae9285d9565d6e1a6e0238a5b1f43fbdb34dde322bdce7bd6264fd81c6eb13","observation_id":"45d531a0-0a4f-4002-ba70-99ca07e15346","resolution":{"observed_at":"2026-08-07T04:50:34.163425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T00:48:20.489334Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-07T11:53:13.790399Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:20.489334Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.12594"},"observation_digest":"sha256:fe74bb4141910df9ed6b2e0c62c4b7ef21cc178b3852e7e6776c5b15e028817a","observation_id":"6027413f-2408-4b54-b3b3-a7bddedb0f2a","resolution":{"observed_at":"2026-08-07T00:48:20.489334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T00:42:00.924943Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13216","last_updated":"2025-06-16T08:16:03Z","snapshot_observed_at":"2026-08-09T06:43:04.058790Z","submitted_at":"2025-06-16T08:16:03Z","title":"Capability Salience Vector: Fine-grained Alignment of Loss and Capabilities for Downstream Task Scaling Law","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:00.924943Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.13216"},"observation_digest":"sha256:8360cf2fd5762f65af7358a95405d4e92a460e4f08eae97ccf4c3e3fa7d4e7c6","observation_id":"3a9f4759-c3dc-40ae-b1c3-776290aa4053","resolution":{"observed_at":"2026-08-07T00:42:00.924943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T00:31:55.961100Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13681","last_updated":"2025-06-19T04:41:52Z","snapshot_observed_at":"2026-08-09T15:13:10.527557Z","submitted_at":"2025-06-16T16:38:04Z","title":"Min-p, Max Exaggeration: A Critical Analysis of Min-p Sampling in Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:31:55.961100Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.13681"},"observation_digest":"sha256:eccd705a8c77cbf74ce2b4313460b118cadeb758c75f5a9e2064f3094aca292e","observation_id":"9b4e5a4b-cb9c-4437-9fbb-da517ee04f3b","resolution":{"observed_at":"2026-08-07T00:31:55.961100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T04:47:18.042981Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13790","last_updated":"2025-08-20T13:47:47Z","snapshot_observed_at":"2026-08-10T01:31:14.540393Z","submitted_at":"2025-06-11T11:40:11Z","title":"The NordDRG AI Benchmark for Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:47:18.042981Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.13790"},"observation_digest":"sha256:f5693b5aad188066466597ad1cdc928820d3547d787a3874f2daf62e2b88e16a","observation_id":"51ec63c1-4f0b-4b96-94f9-a00835c174b3","resolution":{"observed_at":"2026-08-07T04:47:18.042981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T23:33:55.366632Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17630","last_updated":"2025-06-21T08:15:45Z","snapshot_observed_at":"2026-08-08T06:07:41.458492Z","submitted_at":"2025-06-21T08:15:45Z","title":"Answer-Centric or Reasoning-Driven? Uncovering the Latent Memory Anchor in LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:33:55.366632Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.17630"},"observation_digest":"sha256:355797e729bd89103d676d947bfbeceeb8a27711132630fb8e61afcd27f67327","observation_id":"c09e3ada-863a-4154-a90a-278abcdf75a1","resolution":{"observed_at":"2026-08-06T23:33:55.366632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T22:56:31.015321Z","title":"Holistic Evaluation of Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20274","last_updated":"2025-06-25T09:34:25Z","snapshot_observed_at":"2026-08-07T12:25:51.783364Z","submitted_at":"2025-06-25T09:34:25Z","title":"Enterprise Large Language Model Evaluation Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:56:31.015321Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.20274"},"observation_digest":"sha256:135bb8f04040c5a2901e15977682f43fb26fd5592d6d20c461f41c84fd89fe1d","observation_id":"d4c7ccc0-ea19-4d32-8541-39d64b58b2c4","resolution":{"observed_at":"2026-08-06T22:56:31.015321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T22:30:30.910951Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21521","last_updated":"2025-06-29T18:12:45Z","snapshot_observed_at":"2026-08-09T04:44:37.252637Z","submitted_at":"2025-06-26T17:41:35Z","title":"Potemkin Understanding in Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T22:30:30.910951Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.21521"},"observation_digest":"sha256:b26a4134234a4958516e0544b1d3a7885b2eec4f1407656b6195fe5b1efc9016","observation_id":"34dd9cdc-8b85-4a39-9792-2ecfad2c4309","resolution":{"observed_at":"2026-08-06T22:30:30.910951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T00:29:48.278185Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21580","last_updated":"2025-06-16T21:20:08Z","snapshot_observed_at":"2026-08-10T11:03:29.805349Z","submitted_at":"2025-06-16T21:20:08Z","title":"From General Reasoning to Domain Expertise: Uncovering the Limits of Generalization in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:29:48.278185Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.21580"},"observation_digest":"sha256:797a1891cde58a0013cd8e0c9163a2dc2aca216f46648fe7d1e9a41677a6f866","observation_id":"e4365fa1-c857-42c8-b687-24f496d5e057","resolution":{"observed_at":"2026-08-07T00:29:48.278185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T22:14:08.918938Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22262","last_updated":"2025-06-27T14:30:12Z","snapshot_observed_at":"2026-08-11T13:17:12.061042Z","submitted_at":"2025-06-27T14:30:12Z","title":"JointRank: Rank Large Set with Single Pass","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:14:08.918938Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.22262"},"observation_digest":"sha256:7a4aa538063aafaf16b0401e665ce2706a5201fc70abe98915587677b55717e2","observation_id":"4f5c1a77-f935-4365-893d-707fbd1e56f6","resolution":{"observed_at":"2026-08-06T22:14:08.918938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T21:45:02.598843Z","title":"D., Ré, C., Acosta-Navas, D., Hudson, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23706","last_updated":"2025-06-30T10:29:42Z","snapshot_observed_at":"2026-08-08T23:28:19.101327Z","submitted_at":"2025-06-30T10:29:42Z","title":"Attestable Audits: Verifiable AI Safety Benchmarks Using Trusted Execution Environments","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:02.598843Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.23706"},"observation_digest":"sha256:a393d69c8eca2c4524c8ee322cee046cd3a8d5521cba25feaabab548836248b5","observation_id":"927ef670-9513-4afa-9905-0015758b138f","resolution":{"observed_at":"2026-08-06T21:45:02.598843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T21:38:51.600014Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23725","last_updated":"2025-06-30T10:58:36Z","snapshot_observed_at":"2026-08-11T15:51:32.621187Z","submitted_at":"2025-06-30T10:58:36Z","title":"PAC Bench: Do Foundation Models Understand Prerequisites for Executing Manipulation Policies?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:38:51.600014Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2506.23725"},"observation_digest":"sha256:02a33aaedaeb956e9dad8405a9f32034b053281034e7e2283bc7278976d20879","observation_id":"48f7a3a2-f019-4284-862a-59d997839c37","resolution":{"observed_at":"2026-08-06T21:38:51.600014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T20:43:43.336489Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02087","last_updated":"2025-07-28T17:26:01Z","snapshot_observed_at":"2026-08-06T20:36:09.553448Z","submitted_at":"2025-07-02T19:02:18Z","title":"Evaluating the Promise and Pitfalls of LLMs in Hiring Decisions","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:43:43.336489Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2507.02087"},"observation_digest":"sha256:2bc8dbee96f1f27f4cd0735409fedce8d7b18262c3592871898f0e6b29ca2a97","observation_id":"2b2d86e8-0460-49ad-9524-a01d06d5ddaa","resolution":{"observed_at":"2026-08-06T20:43:43.336489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T19:47:46.292328Z","title":"D.; Ré, C.; Acosta-Navas, D.; Hudson, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04641","last_updated":"2025-07-07T03:49:58Z","snapshot_observed_at":"2026-08-07T22:35:20.197323Z","submitted_at":"2025-07-07T03:49:58Z","title":"Toward Valid Measurement Of (Un)fairness For Generative AI: A Proposal For Systematization Through The Lens Of Fair Equality of Chances","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T19:47:46.292328Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2507.04641"},"observation_digest":"sha256:9dd15f04487ecec11680ef5f71979c06b1bdd5ff83739b67785bdd0b041cfa4f","observation_id":"4a4bf49c-402e-4618-9f6d-3ce0e18e69a8","resolution":{"observed_at":"2026-08-06T19:47:46.292328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2211.09110/citation-record","integrity":"/paper/2211.09110/integrity","json":"/paper/2211.09110/citation-record.json","paper":"/paper/2211.09110"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:2c69a3a5eeefb52e4fcd22669be482963798ee58e5cfda467f109cf088a5141d","observation_id":"fd2b9ddb-6b51-4c64-b546-8f994c8bb60e","resolution":{"observed_at":"2026-05-24T10:09:19.266423Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.150","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2021.acl-long.150","venue":null,"work_id":"28ca0026-3906-4281-9006-088b556137d2","year":2021},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:cfbd407a27ced653d6d8de65ca92bc5af05db6291558e3120939f9089f997482","observation_id":"4fc7afca-6d7e-46e3-af1d-835c2d1bc741","resolution":{"observed_at":"2026-05-24T10:09:19.299324Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.4761960","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://glottolog.org/accessed2021-08-08","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"b03a94d5-21f1-4c7f-8e70-54e70f8cd4db","year":2018},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:88b3055a94309b7c0b9d272b97c89e909a933bef2f56f62b03f139ab160ac1f2","observation_id":"d1b20050-8ea6-4d4b-ba5b-c3abdc75b098","resolution":{"observed_at":"2026-05-24T10:09:19.283766Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":"2105.09938","doi":"10.18653/v1/2021.eacl-main.225","metadata_source":"pith","pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Coding Challenge Competence With APPS","venue":"cs.SE","work_id":"c014c12f-1080-4cb2-ae03-ab6b7c09445c","year":2021},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:eef86e681db064a10244198df3d1bbc47e1877a9d5fc0096289f68038e393b74","observation_id":"7b7f0655-19dc-4471-b9be-85b3bb247e18","resolution":{"observed_at":"2026-05-24T10:09:19.289641Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"oxfordhb/9780199","doi":"10.1093/oxfordhb/9780199286546.001.0001/","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In Christopher Hitchcock & Alan Hajek, edi- tors: Oxford Handbook of Probability and Philosophy , Oxford University Press, pp","venue":null,"work_id":"14395009-699b-40c7-94de-6004ef131037","year":2008},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:7d01ad983088dcb2f47f8a877568471401dd0f22db07b09a454976e179e73ad5","observation_id":"8e60302d-56ca-4737-8cc1-67f5948ec5e3","resolution":{"observed_at":"2026-05-24T10:09:19.254183Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.cognition.2007.05.006","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cognition , year =","venue":"Cognition","work_id":"b71d974a-c34c-4e5e-8062-c7e8770974ba","year":2008},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:9165da2e640df5e252516acb6ab15c40c2144e560fe96f16528a19814c3118a4","observation_id":"333e3eee-7498-4e14-a12c-24d304c33015","resolution":{"observed_at":"2026-05-24T10:09:19.273599Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:35.114111+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:35.114111+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08730","last_updated":"2018-06-20T16:39:26Z","snapshot_observed_at":"2026-07-06T06:46:18.285019Z","submitted_at":"2018-06-20T16:39:26Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","version":1},"cited_work":{"arxiv_id":"1806.08730","doi":"10.2466/pr0.1957.3.3.635","metadata_source":"pith","pith_arxiv_id":"1806.08730","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","venue":"cs.CL","work_id":"75b95963-bb63-4588-816d-17e4bf36092e","year":2018},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1806.08730","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:81f154bd8404f9723c4e08d3492c25d3aee9e018944a08f661f30b7ae932f436","observation_id":"655b68ab-0010-4a0d-9fbf-3528748e4909","resolution":{"observed_at":"2026-05-24T10:09:19.279889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":"2202.03286","doi":"10.48550/arxiv.2202.03286","metadata_source":"pith","pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Red Teaming Language Models with Language Models","venue":"cs.CL","work_id":"d1274c54-508f-42f9-aeb3-91db13f3a622","year":2022},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:15ff901b8be6a1eb6e1172a9db624d6ebe6c5d1dc893677a05e05e913091cca5","observation_id":"c7150b94-318f-4e30-8f44-5d369f022534","resolution":{"observed_at":"2026-05-24T10:09:19.693997Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-08-10T00:54:02.555288Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03350","doi":"10.1007/s11229-022-03791-y","metadata_source":"pith","pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","venue":"cs.CL","work_id":"79aa4add-ff4a-4871-9c74-6f473b0579c1","year":2022},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:d803292a12922e3137e7358cd71bc9f70d3c0612b764604998e516a7240b8330","observation_id":"c7b09df6-a83c-4bda-affe-0aebbf696222","resolution":{"observed_at":"2026-05-24T10:09:19.294997Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":"2211.05100","doi":"10.48550/arxiv.2211.05100","metadata_source":"pith","pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","venue":"cs.CL","work_id":"337ba690-f35d-4154-9450-8edf4bc9f488","year":2022},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:c7f65d8385ff30f3ad198819ce9e5d53fd17814780afeb5db3bcea7d4a73c594","observation_id":"02724bfe-2e4b-42b2-beaf-c73880838e9c","resolution":{"observed_at":"2026-05-24T10:09:19.247836Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0276.246027","doi":"10.1145/2460276.2460278","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yes” or “No","venue":"Queue","work_id":"91965f25-2acc-4ae2-b3f1-96a5347551cd","year":2014},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:ae020760b2cae5a7f8b802933b6e619d1015bc6ede32f806fb8500beed32458e","observation_id":"bbe34219-0bfc-444e-9d46-7e8bfdb9d9c2","resolution":{"observed_at":"2026-05-24T10:09:19.260372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8265190e-93ac-495f-a516-9d904041cf9c","year":2022},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:393eb3f9cbf08c5d6ffcb9d80f41494be3171dd9b51dda9b0af9d856e6e87528","observation_id":"73b5c53d-ac5d-40d7-80f5-ae782b89d9e2","resolution":{"observed_at":"2026-05-24T10:19:19.794025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9607ab4-1e5f-4fc9-ba2b-464681f9db3b","year":2022},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:b351ed0f8520619b0a2f3adcb58c8a100797568fea77627bdaa1ecf9e45b588a","observation_id":"99063e66-2f6c-4e86-9ca2-88dc4e348cd1","resolution":{"observed_at":"2026-05-24T10:19:19.797403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grandfather","venue":null,"work_id":"cd66469d-081a-49fc-8eb0-3f973d7db6a6","year":2018},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:7c83df0d75a8f98fd6555181fd965f1acf202b4d79d0e85f85ea977e2167a089","observation_id":"d10ca844-e51b-418c-b639-d9e2b9f95339","resolution":{"observed_at":"2026-05-24T10:19:19.813945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2017), which derives its list form Greenwald et al","venue":null,"work_id":"9e90edaf-e1b8-40bb-94a2-adba8b39297b","year":2017},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:00e671e052f4a2d91cd449bac9fc9127ca71529222173d98447de7c09417c00f","observation_id":"85ae1069-f0e0-4dac-9230-449b76a51acf","resolution":{"observed_at":"2026-05-24T10:19:19.805151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(2018), which derives its list form Chalabi & Flowers (2017)","venue":null,"work_id":"dbc3dfa0-d561-470e-82e2-9df92394cee0","year":2018},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:0fdde4698d69502add0037df224cc800ffdfa7408c60d3a6814c7d53e58d2127","observation_id":"edd232ba-c256-498d-8d6d-8b31e9d535ce","resolution":{"observed_at":"2026-05-24T10:19:19.811250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It came from down here","venue":null,"work_id":"57847938-6283-4a51-8c1e-85cb93c2447f","year":2020},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:9eb953363f078878ad6983f06196d593a2d4e308de9c9278117b2ed3c5401423","observation_id":"20e4603d-6d17-4152-bf89-71769e843b82","resolution":{"observed_at":"2026-05-24T10:19:19.802573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"42c171dc-b33f-42f1-87ac-170ae5620cfb","year":null},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:de4844c28b66b1248454f8dd203569996499f11bfe69b95e6f3911e0b81b2bb6","observation_id":"740f62a9-1862-4a24-bf73-b9fb2a035933","resolution":{"observed_at":"2026-05-24T10:19:19.800328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a073121-6b70-45f4-ad80-8f72d6ab2bfe","year":2023},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:a54c2df448211763c249bf68135ad706b26c19f951c5fbb850e3520dd1021290","observation_id":"ce64fb07-b7be-4c50-8c71-8c8963c0a340","resolution":{"observed_at":"2026-05-24T10:19:19.807714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The capital of France is __","venue":null,"work_id":"e8555b6b-3f1a-4742-81b8-c0b2bd547845","year":2046},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:07ba65a5faca5813ddf85fb9e0b41bc91708b767273a2aaf8c215bdbcac39e6b","observation_id":"37e2122b-5091-448f-890e-09361fe234a0","resolution":{"observed_at":"2026-05-24T10:19:19.791793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":"2211.05100","doi":"10.48550/arxiv.2211.05100","metadata_source":"pith","pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","venue":"cs.CL","work_id":"337ba690-f35d-4154-9450-8edf4bc9f488","year":2022},"citing_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T10:06:30.552785Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2211.09110"},"observation_digest":"sha256:ccecc3c00e92717186bcade6ced662ffb4d76ef32c7ee5abef534059f3e19799","observation_id":"95af2df3-d032-4c58-b63e-9a27e2ff1c79","resolution":{"observed_at":"2026-05-24T10:09:19.667240Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T16:25:57.975024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":2,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":4,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 100 inbound Pith citation observations for arXiv:2211.09110."}