{"as_of":"2026-08-09T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aec95109ec2f9b6d5c2b7fca118bcf09e00712b3ad54a36d46d97311767c4143","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:35:42.932998Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:59:00.294806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T13:35:26.411399Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09670","snapshot_observed_at":"2026-08-03T20:59:00.294806Z","title":"The science of evaluating foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17826","last_updated":"2026-05-29T02:47:21Z","snapshot_observed_at":"2026-08-07T23:47:18.366376Z","submitted_at":"2025-11-21T22:40:00Z","title":"Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T20:59:00.294806Z"},"links":{"cited_paper":"/paper/2502.09670","citing_paper":"/paper/2511.17826"},"observation_digest":"sha256:9cd01ac861af2a15e71a312ca5090ee0c10434129a1c7d023c15f9e5db5a07ed","observation_id":"2fabdbc0-8037-4596-bd31-d827de9ce9cf","resolution":{"observed_at":"2026-08-03T20:59:00.294806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"cited_work":{"arxiv_id":"2502.09670","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.09670","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding and mitigating numerical sources of nondeterminism in llm inference","venue":null,"work_id":"5c64ec67-2c63-468f-ad51-72f8eea05879","year":null},"citing_paper":{"arxiv_id":"2604.13413","last_updated":"2026-04-15T02:31:31Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:31:31Z","title":"Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T13:31:46.940449Z"},"links":{"cited_paper":"/paper/2502.09670","citing_paper":"/paper/2604.13413"},"observation_digest":"sha256:7f154a9eb1ab3e29838f2fe46c7b678eb78a37fb251407b21fbbfa54326e9a46","observation_id":"df984a59-0850-4fc8-88b0-ca88a2f458de","resolution":{"observed_at":"2026-05-10T13:35:26.412843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09670","snapshot_observed_at":"2026-07-12T20:50:53.567415Z","title":"Understanding and mitigating numerical sources of nondeterminism in llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13416","last_updated":"2026-07-06T05:33:02Z","snapshot_observed_at":"2026-08-02T11:35:00.658422Z","submitted_at":"2026-04-15T02:33:44Z","title":"DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T20:50:53.567415Z"},"links":{"cited_paper":"/paper/2502.09670","citing_paper":"/paper/2604.13416"},"observation_digest":"sha256:ad9b205c3bb68112d5210ecc6ac0c64d4b12bb7802bd0b710ddc4fac8d3749c9","observation_id":"817c9b0d-9628-423d-9255-866ac54a79ff","resolution":{"observed_at":"2026-07-12T20:50:53.567415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09670/citation-record","integrity":"/paper/2502.09670/integrity","json":"/paper/2502.09670/citation-record.json","paper":"/paper/2502.09670"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T23:35:42.614892Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.614892Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:fcc1f08a5daa49ddbe8438ea8149dfa279e1ea5fcd42e5bc428f9a93a260f190","observation_id":"42c9f172-4f43-45bb-a54b-f79576fea6e9","resolution":{"observed_at":"2026-08-07T23:35:42.614892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.619032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.619032Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:5cfb9804d76ec9de74f7dac27c53c306a7e163cfd977cc1f2f6d68a239546fe8","observation_id":"7a60ccf5-011b-40cb-a6bf-a6017ed74b60","resolution":{"observed_at":"2026-08-07T23:35:42.619032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09024","snapshot_observed_at":"2026-08-07T23:35:42.621868Z","title":"Zico Kolter, Matt Fredrikson, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.621868Z"},"links":{"cited_paper":"/paper/2410.09024","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e3d640bc05affc4c1ba2472f62a1f1cb08ae845cba165befdc09b978f931d2fd","observation_id":"6f7afbaa-a360-4dd2-ad22-312df632e1e6","resolution":{"observed_at":"2026-08-07T23:35:42.621868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T23:35:42.625010Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.625010Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9e3e80ebce60b5193a03fd65f0987abc4ae18b086a51e27e264d20978b0192a1","observation_id":"8f75078f-c123-401a-a525-63783e7c7e83","resolution":{"observed_at":"2026-08-07T23:35:42.625010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-07T23:35:42.628193Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.628193Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:ad6314f3e72cf1ace9d05eaa2f16e1bfa6bfe3fd199af58feba0fec28dec66e6","observation_id":"1e7b9739-cbf3-4c4b-9f8b-764e250d0aae","resolution":{"observed_at":"2026-08-07T23:35:42.628193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.631123Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.631123Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:8e1079493951f5d49291ca78f0ebad8e898039769ae9a8bce2d2dda30a0c6b40","observation_id":"54d987c0-95d4-4044-9d51-e53b33a6e710","resolution":{"observed_at":"2026-08-07T23:35:42.631123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.634066Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.634066Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:dc5e58b88054e15d8430c64a3ac5459680642676b900aacd6fb31fe7c827c7ee","observation_id":"41511bae-4253-4804-b53a-48a73a38451c","resolution":{"observed_at":"2026-08-07T23:35:42.634066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.05326","last_updated":"2015-08-21T16:17:01Z","snapshot_observed_at":"2026-08-05T22:08:24.004344Z","submitted_at":"2015-08-21T16:17:01Z","title":"A large annotated corpus for learning natural language inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.05326","snapshot_observed_at":"2026-08-07T23:35:42.637213Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.637213Z"},"links":{"cited_paper":"/paper/1508.05326","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:8479f7d651dfd489db9708c8124344af8692df9ecb4852422a60c0110117cfd7","observation_id":"b85ccb95-4a73-48d2-b1e6-a9281c26e127","resolution":{"observed_at":"2026-08-07T23:35:42.637213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.640482Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.640482Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0ccdf921c058d824f7c6f4f1bf14cc09c2d4eb7199dddae22c7092f991acf078","observation_id":"5967fedb-279c-4f5d-b6e8-245121c56191","resolution":{"observed_at":"2026-08-07T23:35:42.640482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.643255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.643255Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b893d3b1d5eb24d4e5a9c77872224be7e58648d911316f8ad9ff8f33885616f8","observation_id":"b9a4d036-ebc9-4ecd-9edd-e3393beb80e4","resolution":{"observed_at":"2026-08-07T23:35:42.643255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08678","last_updated":"2023-07-17T17:41:47Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:41:47Z","title":"Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08678","snapshot_observed_at":"2026-08-07T23:35:42.646158Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.646158Z"},"links":{"cited_paper":"/paper/2307.08678","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0abb0b8994ad7c4d70a4ab33d3f71158145cfafa56df76443e83bedc68000939","observation_id":"29df79b0-d079-4839-bd57-ba240b292bfa","resolution":{"observed_at":"2026-08-07T23:35:42.646158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T23:35:42.649410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.649410Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4045dd46aab1475d3c33a1e8ee8155585640fe9da74149db056a6ecac9767dd9","observation_id":"7e87e0c8-0110-4424-b767-beb1980c8365","resolution":{"observed_at":"2026-08-07T23:35:42.649410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02657","last_updated":"2021-05-07T15:58:45Z","snapshot_observed_at":"2026-07-06T11:06:51.715697Z","submitted_at":"2021-05-06T13:35:03Z","title":"Improving the Faithfulness of Attention-based Explanations with Task-specific Information for Text Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.02657","snapshot_observed_at":"2026-08-07T23:35:42.652396Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.652396Z"},"links":{"cited_paper":"/paper/2105.02657","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:5b09993abeeb6f81e3db095c0b77bcd1a47b24dabdebef004824f55734c50237","observation_id":"8ab6763d-8366-497c-8cf7-6fd8c8c54b69","resolution":{"observed_at":"2026-08-07T23:35:42.652396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.655458Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.655458Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:7c68dd52f11dfaa3b7404daaae941d9f771a8f37cb39e6aacfedb7ccb1a02a9d","observation_id":"fe5d6907-4908-4224-bf26-be7280651b14","resolution":{"observed_at":"2026-08-07T23:35:42.655458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09670","last_updated":"2021-10-31T20:03:39Z","snapshot_observed_at":"2026-08-09T09:16:24.377074Z","submitted_at":"2020-10-19T17:06:18Z","title":"RobustBench: a standardized adversarial robustness benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09670","snapshot_observed_at":"2026-08-07T23:35:42.658408Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.658408Z"},"links":{"cited_paper":"/paper/2010.09670","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d9d15ce5275460c6179bd761f4d139674e55e60d224ace51de447b6c211835c1","observation_id":"1596f007-4aa1-4066-9a88-8c96bc8e9316","resolution":{"observed_at":"2026-08-07T23:35:42.658408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05778","last_updated":"2024-01-11T09:29:56Z","snapshot_observed_at":"2026-08-05T00:16:01.594011Z","submitted_at":"2024-01-11T09:29:56Z","title":"Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05778","snapshot_observed_at":"2026-08-07T23:35:42.661836Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.661836Z"},"links":{"cited_paper":"/paper/2401.05778","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a2408a23df8eb27d5b8bd4bddf436dd43a5ef20e59b697b2fe4810d1e9f40f4f","observation_id":"80be2df7-f961-48de-a6bf-b87100cf0ffb","resolution":{"observed_at":"2026-08-07T23:35:42.661836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.664945Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.664945Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:73e5b9de4e6ee82bb7101b508cfe439601a71ed7f6dd0530cba2b67004fa3521","observation_id":"3537a145-0e41-4fe3-80e4-182d8abd2937","resolution":{"observed_at":"2026-08-07T23:35:42.664945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03429","last_updated":"2020-04-24T17:25:40Z","snapshot_observed_at":"2026-08-08T21:47:19.189690Z","submitted_at":"2019-11-08T18:29:03Z","title":"ERASER: A Benchmark to Evaluate Rationalized NLP Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03429","snapshot_observed_at":"2026-08-07T23:35:42.667856Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.667856Z"},"links":{"cited_paper":"/paper/1911.03429","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:188fd3947fceaf18049c51641420830612e9ab2181b353215c49c44936a8ed0e","observation_id":"45b93dc5-4227-475a-9f92-ee852864aeb3","resolution":{"observed_at":"2026-08-07T23:35:42.667856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.671333Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.671333Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:451482d2dd9a9d937c4068c5d47dac3f60a953d7fcc67821fb7286c253866197","observation_id":"e5204879-ae56-4307-a2e4-b57e582ad2d3","resolution":{"observed_at":"2026-08-07T23:35:42.671333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.674183Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.674183Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:7b6949d11598bd53127df6b295795d35cf58fad68cefdaac515e8e74da72662e","observation_id":"5a6fbcf9-4b9d-4bf2-856e-f4cb37c65970","resolution":{"observed_at":"2026-08-07T23:35:42.674183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.677278Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.677278Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:ba425b80a3d34d517e1a950dafb403de657a2778cd9b662a3345a00b53813e8c","observation_id":"706442f5-54ec-4af2-82af-ac355f421310","resolution":{"observed_at":"2026-08-07T23:35:42.677278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.08362","last_updated":"2019-09-10T04:12:17Z","snapshot_observed_at":"2026-07-06T06:51:38.176531Z","submitted_at":"2018-07-22T20:37:45Z","title":"An Intersectional Definition of Fairness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.08362","snapshot_observed_at":"2026-08-07T23:35:42.680314Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.680314Z"},"links":{"cited_paper":"/paper/1807.08362","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:df9b00027c9cae275ad861416b364fb712ca1a9d8272f831bb53a3541381ea51","observation_id":"b512d5ff-cb96-4239-a582-af833ebb7998","resolution":{"observed_at":"2026-08-07T23:35:42.680314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08500","last_updated":"2017-06-01T14:10:34Z","snapshot_observed_at":"2026-07-06T05:43:59.308291Z","submitted_at":"2017-05-23T19:43:56Z","title":"Selective Classification for Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08500","snapshot_observed_at":"2026-08-07T23:35:42.683229Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.683229Z"},"links":{"cited_paper":"/paper/1705.08500","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:66474d95a2afc0797d75f7ef0cfaabb30b4d1f7d3d76a94c63b544e54df76995","observation_id":"f66b685a-41b0-454b-b26f-954ce8367b2e","resolution":{"observed_at":"2026-08-07T23:35:42.683229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.686588Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.686588Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:2078baefaab80d29a314f7d3a869874fd73251602b1c793d31eb795052160210","observation_id":"90609972-6f82-472e-8db8-3423a1fe6404","resolution":{"observed_at":"2026-08-07T23:35:42.686588Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-07T08:05:23.979918Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-08-07T23:35:42.689465Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.689465Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:74a92680be025f0afddde2c721595b21b02bdc535b33e3c20561f6ccd2b0cc3d","observation_id":"57fca449-93b7-4e35-9ca3-947cb0e00a98","resolution":{"observed_at":"2026-08-07T23:35:42.689465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-06T19:10:15.466826Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-07T23:35:42.692496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.692496Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f1879d9e3454b2d0b3ccaf9e444b98b6602cbf9d4fc82a36f0786cb713863bf5","observation_id":"ed300267-aa21-4039-8308-acb5efe10507","resolution":{"observed_at":"2026-08-07T23:35:42.692496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-07T23:35:42.695574Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.695574Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f2fffc478ae33f575c5efa7b0716d6624e81b560e70e9217b9d71467628c6ad5","observation_id":"c49507bc-c841-4861-a8c9-d433c0f1f365","resolution":{"observed_at":"2026-08-07T23:35:42.695574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05904","last_updated":"2024-04-17T07:03:17Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T23:16:22Z","title":"The Hallucinations Leaderboard -- An Open Effort to Measure Hallucinations in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05904","snapshot_observed_at":"2026-08-07T23:35:42.698050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.698050Z"},"links":{"cited_paper":"/paper/2404.05904","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:1ecfdcb277aa092495f819b97fae542d72729df58090acfd6bfdb0ad302a2362","observation_id":"9ae3ded5-0dbb-4794-accb-8e714e4015cf","resolution":{"observed_at":"2026-08-07T23:35:42.698050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.700573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.700573Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:30b5229195573bb05e273d6d72d914ca885a5faf230909babdb1da00f75cfb48","observation_id":"12b41117-de41-4783-9142-bb499db5a010","resolution":{"observed_at":"2026-08-07T23:35:42.700573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.702763Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.702763Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9b37c7fb3d6238364f04c10343b95b9f558663423c3e54a567316062806efb4f","observation_id":"0a328410-f232-4698-99d7-280aaf548897","resolution":{"observed_at":"2026-08-07T23:35:42.702763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T23:35:42.704954Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.704954Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:055ea8d8fe1bbae45a48b5eaea9ffacccd05c8ea0be902f8dabe30fc268e707a","observation_id":"8f579ee1-1005-4ee9-8589-065189ae3929","resolution":{"observed_at":"2026-08-07T23:35:42.704954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11932","last_updated":"2020-04-08T23:10:10Z","snapshot_observed_at":"2026-07-06T08:10:40.079646Z","submitted_at":"2019-07-27T15:07:04Z","title":"Is BERT Really Robust? A Strong Baseline for Natural Language Attack on Text Classification and Entailment","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11932","snapshot_observed_at":"2026-08-07T23:35:42.707286Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.707286Z"},"links":{"cited_paper":"/paper/1907.11932","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:cf1aab7a1af4d3997b05112a01d4cef54f8d3b2eed5b09519fc9f1440950df9f","observation_id":"d995213e-6350-442b-842a-42a32a09be59","resolution":{"observed_at":"2026-08-07T23:35:42.707286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.709720Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.709720Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9db9ca9de397e5becdae7e52b3b94d617b3f73cb62fa6e9c8466093f33154614","observation_id":"53901a15-baae-434b-a914-f309e49e8e35","resolution":{"observed_at":"2026-08-07T23:35:42.709720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.715639Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.715639Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4cb092889c989276911621e8d48c91d52a9b329ec6d96b5aad097fb91b3a3db9","observation_id":"972216ea-dae4-4d33-b25f-1cb12a26cb26","resolution":{"observed_at":"2026-08-07T23:35:42.715639Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07421","last_updated":"2021-07-16T17:58:22Z","snapshot_observed_at":"2026-07-06T10:24:09.094124Z","submitted_at":"2020-12-14T11:14:56Z","title":"WILDS: A Benchmark of in-the-Wild Distribution Shifts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07421","snapshot_observed_at":"2026-08-07T23:35:42.718445Z","title":"Earnshaw, Imran S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.718445Z"},"links":{"cited_paper":"/paper/2012.07421","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:cec09261ffc6ad9b454a7c489dfb57a37c149e33cadd31e85f129ea5a807d9a6","observation_id":"552ef713-bd7d-483a-9c03-a35e71a76be5","resolution":{"observed_at":"2026-08-07T23:35:42.718445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.721987Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.721987Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c0efb4269fb949a21172f9c64d815e7fc12a908aeb2b6fbf7316ea01d2c402ad","observation_id":"cad99ac7-c79a-42bf-90e9-c92e65216222","resolution":{"observed_at":"2026-08-07T23:35:42.721987Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.724900Z","title":"Dai, Jakob Uszkor- eit, Quoc Le, and Slav Petrov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.724900Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:befd32fdd9fac5ff02596c9fa0ca094e7ede205988acab107bfc7168514d40db","observation_id":"a59ec1e8-3887-4873-9d5f-81906eb6e7b0","resolution":{"observed_at":"2026-08-07T23:35:42.724900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T23:35:42.727917Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.727917Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:ee21ee7c691390b2fdd558e56312023a3d3cab24791f8363f9f5f488a74b2400","observation_id":"075f5f71-150d-420a-a730-4a4277b33180","resolution":{"observed_at":"2026-08-07T23:35:42.727917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.731195Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.731195Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9459b7a0f4e14f1a1911862a0256cffd4209eac0069a0e56cb53425b689d3da5","observation_id":"a619e8b3-ff6f-4ee2-8d17-20b15e5522da","resolution":{"observed_at":"2026-08-07T23:35:42.731195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09746","last_updated":"2024-01-05T22:09:26Z","snapshot_observed_at":"2026-08-09T13:09:57.575229Z","submitted_at":"2022-12-19T18:59:45Z","title":"Evaluating Human-Language Model Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09746","snapshot_observed_at":"2026-08-07T23:35:42.734153Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.734153Z"},"links":{"cited_paper":"/paper/2212.09746","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c1296a5eb95a671c16dff5cf2c369118db2effa1aa93923adc609020e418323d","observation_id":"65441e79-c127-4d2f-b3c1-c41653c992cc","resolution":{"observed_at":"2026-08-07T23:35:42.734153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13788","last_updated":"2023-10-27T11:25:00Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T07:55:34Z","title":"Can Large Language Models Capture Dissenting Human Voices?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13788","snapshot_observed_at":"2026-08-07T23:35:42.737130Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.737130Z"},"links":{"cited_paper":"/paper/2305.13788","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:5223f1b7cf14a722f6211b54bba1aa262cf4c162a47096fa6549427bf6e9a9bd","observation_id":"6be26943-f8c2-421c-884b-dba5cd61f4c9","resolution":{"observed_at":"2026-08-07T23:35:42.737130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11747","last_updated":"2023-10-23T01:49:32Z","snapshot_observed_at":"2026-08-07T22:56:15.588770Z","submitted_at":"2023-05-19T15:36:27Z","title":"HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11747","snapshot_observed_at":"2026-08-07T23:35:42.740185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.740185Z"},"links":{"cited_paper":"/paper/2305.11747","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:506aecde731249bb7665e7330687dcf75998323b59d3024584abb043f5332b87","observation_id":"90b11f8a-52fb-4b25-9266-8b7ae0f47d75","resolution":{"observed_at":"2026-08-07T23:35:42.740185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.743247Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.743247Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b3ad15da354bfae6459afb1127c4ad13e154a641eb04017e1fe4b4cb83d54941","observation_id":"2a33283f-1f8c-4b73-8fa4-c8bc1bec5053","resolution":{"observed_at":"2026-08-07T23:35:42.743247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T23:35:42.752311Z","title":"Manning, Christo- pher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.752311Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:82756ac5b1dcecc5bc33a7b1c0e0aa8c7e7b3c990bf11d3b78a70bb49b187a36","observation_id":"88eb5930-81a1-40fd-bdd6-eebf5bcb7c84","resolution":{"observed_at":"2026-08-07T23:35:42.752311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06509","last_updated":"2024-03-05T12:07:04Z","snapshot_observed_at":"2026-07-06T17:14:45.068795Z","submitted_at":"2024-01-12T11:18:00Z","title":"AntEval: Evaluation of Social Interaction Competencies in LLM-Driven Agents","version":3},"cited_work":{"arxiv_id":"2401.06509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06509","snapshot_observed_at":"2026-08-07T23:35:43.382397Z","title":"AntEval: Evaluation of Social Interaction Competencies in LLM-Driven Agents","venue":"cs.CL","work_id":"6ccdbfa8-a569-49da-8b5d-d6840605834a","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.755226Z"},"links":{"cited_paper":"/paper/2401.06509","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f14e29b2460e48fe3ee27af61117491ef8c0acd086f614691097e4be1ddf2c8e","observation_id":"f4539750-84aa-460b-904f-863ae408ad74","resolution":{"observed_at":"2026-08-07T23:35:43.385959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.758625Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.758625Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:65c0fee42703468d7397694caf3b6dd8995c4e3fc59b792e09710c9eee051e27","observation_id":"f9d79ee3-df9a-4330-8066-1f8c920c6163","resolution":{"observed_at":"2026-08-07T23:35:42.758625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13809","last_updated":"2024-06-05T07:40:54Z","snapshot_observed_at":"2026-08-04T06:11:31.626301Z","submitted_at":"2023-03-24T05:05:03Z","title":"Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13809","snapshot_observed_at":"2026-08-07T23:35:42.761353Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.761353Z"},"links":{"cited_paper":"/paper/2303.13809","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:145e485cd5edac8b54b9df7de94ae8a28b30d39a035b9e07cf4981231bc1d1a9","observation_id":"6338a6ff-677a-4838-86d6-58c4a007de11","resolution":{"observed_at":"2026-08-07T23:35:42.761353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.764319Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.764319Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:1370dc755d5250a46b233b33a63b5fb43563549c4367e4566f24efa94c654b02","observation_id":"358695cd-1638-4b11-81ea-3e5ca8383f1b","resolution":{"observed_at":"2026-08-07T23:35:42.764319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09090","last_updated":"2024-10-07T16:01:06Z","snapshot_observed_at":"2026-07-06T16:48:01.451153Z","submitted_at":"2023-11-15T16:35:59Z","title":"Social Bias Probing: Fairness Benchmarking for Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09090","snapshot_observed_at":"2026-08-07T23:35:42.767138Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.767138Z"},"links":{"cited_paper":"/paper/2311.09090","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:897abf408ec00693f363a44212f680a889aa588cb432a0f26cab5b205f249e79","observation_id":"3620ce70-def8-4509-b833-ea60b5484b25","resolution":{"observed_at":"2026-08-07T23:35:42.767138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.770006Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.770006Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a65b41b32620fb66dd8067b34a961b0688e52c20270280b23ce5604e3796267d","observation_id":"9ad605d3-0278-4cc8-9617-9aee498174d5","resolution":{"observed_at":"2026-08-07T23:35:42.770006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09456","last_updated":"2020-04-20T17:14:33Z","snapshot_observed_at":"2026-07-06T09:13:46.854094Z","submitted_at":"2020-04-20T17:14:33Z","title":"StereoSet: Measuring stereotypical bias in pretrained language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09456","snapshot_observed_at":"2026-08-07T23:35:42.774783Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.774783Z"},"links":{"cited_paper":"/paper/2004.09456","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:d72c828fc26d382718f33f5d55f05d6c946e8dce72281842ee50bf33f77d1433","observation_id":"c116ac70-da36-4744-993d-1caae578a27c","resolution":{"observed_at":"2026-08-07T23:35:42.774783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.777377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.777377Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:63ef1822f8bb1839d18f08900d8d5d17e25e1896648e62ab9200c9c16e79f43a","observation_id":"e110ec71-f37a-4eee-bcae-08209c44724d","resolution":{"observed_at":"2026-08-07T23:35:42.777377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T23:35:42.772371Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.772371Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:ee8ab7ec96a7f1dfc705da3ede04a8d5643c8c547ff245b3f4a043691a19775f","observation_id":"d9a87917-5e9f-4fd5-9f10-1e37eab5d1a8","resolution":{"observed_at":"2026-08-07T23:35:42.772371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.787601Z","title":"Cohen, and Mirella Lapata","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.787601Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:2cf66a43ee40c864f557bf1d215cad2b26207ff7f8c3482517b789cefbfb6b1a","observation_id":"b030956a-0cfb-4015-96ce-8a20373fa5e8","resolution":{"observed_at":"2026-08-07T23:35:42.787601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.790559Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.790559Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:856adbbdb616401a54ec66ae7f71f40d7f13c2ef978e33205fc4125cce76500d","observation_id":"1f715672-1eff-412e-8e4c-c29850f55252","resolution":{"observed_at":"2026-08-07T23:35:42.790559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.06023","last_updated":"2016-08-26T16:13:13Z","snapshot_observed_at":"2026-07-30T19:30:50.474373Z","submitted_at":"2016-02-19T02:04:18Z","title":"Abstractive Text Summarization Using Sequence-to-Sequence RNNs and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.06023","snapshot_observed_at":"2026-08-07T23:35:42.779786Z","title":"arXiv preprint arXiv:1602.06023 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.779786Z"},"links":{"cited_paper":"/paper/1602.06023","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:7bbb795ee57398340d954d07f39624f5e8052050b0f4da59124aea5067d96377","observation_id":"fe1fa383-b0af-4bd7-befa-bbc665696e72","resolution":{"observed_at":"2026-08-07T23:35:42.779786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.782282Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.782282Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:eb312c8f0b5e6a5d22f0953a3d336765ca84caa29e982fc04aeb205a460f51ad","observation_id":"81653e57-c00c-4a4a-9b16-663d87670804","resolution":{"observed_at":"2026-08-07T23:35:42.782282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.802455Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.802455Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9005cb6b33d167f8f6d537a0f48b4a8cf7ee62f774df5adc1b743670bccd557e","observation_id":"90319e29-dc75-449c-87b7-3c6aa7c23604","resolution":{"observed_at":"2026-08-07T23:35:42.802455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06476","last_updated":"2023-11-19T15:43:58Z","snapshot_observed_at":"2026-08-06T16:59:58.620330Z","submitted_at":"2023-02-08T09:44:51Z","title":"Is ChatGPT a General-Purpose Natural Language Processing Task Solver?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06476","snapshot_observed_at":"2026-08-07T23:35:42.805153Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.805153Z"},"links":{"cited_paper":"/paper/2302.06476","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c7662d8cbaea3ae1c19ee23036ee34a2d81e97bef70cbd60030c6d6efd9e6e74","observation_id":"98b069ff-6c98-47d4-8c32-b0b209f1ef16","resolution":{"observed_at":"2026-08-07T23:35:42.805153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.808366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.808366Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:5d380a6a7bdcb757c6628d02f92673e096cc655e225ede4be74b8f8c5d7d17cc","observation_id":"bb7c04e8-9804-4129-8c8b-a96455d5984a","resolution":{"observed_at":"2026-08-07T23:35:42.808366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.793354Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.793354Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:cc9639cb5cdf1e5e28d56db613d04f8930889b546ec030e67ecbad5f9a326ed6","observation_id":"2d65a7e5-c86c-47ff-9d8a-40cf58e7980a","resolution":{"observed_at":"2026-08-07T23:35:42.793354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11768","last_updated":"2023-07-25T04:01:43Z","snapshot_observed_at":"2026-07-06T15:57:04.900537Z","submitted_at":"2023-07-17T00:54:10Z","title":"Question Decomposition Improves the Faithfulness of Model-Generated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11768","snapshot_observed_at":"2026-08-07T23:35:42.817579Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.817579Z"},"links":{"cited_paper":"/paper/2307.11768","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:3941225879d67cd53a57eee8c05f415c535ac19a14232a948d2e6f9d4cbbdca3","observation_id":"23278487-8ae8-4dd8-b04e-786112a023a7","resolution":{"observed_at":"2026-08-07T23:35:42.817579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00936","last_updated":"2024-06-03T02:20:03Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T02:20:03Z","title":"A Survey of Useful LLM Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00936","snapshot_observed_at":"2026-08-07T23:35:42.799324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.799324Z"},"links":{"cited_paper":"/paper/2406.00936","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:7ee9f0ea6742a127f975b0791828c3994e2198a079ae22b2f68a50e8cc7f9413","observation_id":"b750a0c5-1e45-4cf6-bb69-966979345786","resolution":{"observed_at":"2026-08-07T23:35:42.799324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.823750Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.823750Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:497550c12199fabc24a12373bbd0d87a6a80803e77717b2d1b1ee069c5ebd7fc","observation_id":"2c0b10e6-86cd-480f-9519-3439a79e9530","resolution":{"observed_at":"2026-08-07T23:35:42.823750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.829679Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.829679Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:47fd85d9938b4dcf8904c91aec2e1e01601636e3ba4ecafafddbfccbdbd75e99","observation_id":"a1f5741e-f9c0-45b3-a459-22c647d2a224","resolution":{"observed_at":"2026-08-07T23:35:42.829679Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.832607Z","title":"Rush, Sumit Chopra, and Jason Weston","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.832607Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:1d53e55d167e9fc0f932083e755f779bb36cd4339b96718834031002d4171ac3","observation_id":"dec6e7cb-b5c9-48f1-8070-dfe70d40a234","resolution":{"observed_at":"2026-08-07T23:35:42.832607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0306050","last_updated":"2003-06-12T12:35:00Z","snapshot_observed_at":"2026-08-01T18:48:46.592760Z","submitted_at":"2003-06-12T12:35:00Z","title":"Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0306050","snapshot_observed_at":"2026-08-07T23:35:42.835466Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.835466Z"},"links":{"cited_paper":"/paper/cs/0306050","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:313e7673fac9960b75c81a4a451afffdb2314fedbf9a29d4029575a54a0f0a6f","observation_id":"13445a94-7ada-472e-be00-90bbbe398e95","resolution":{"observed_at":"2026-08-07T23:35:42.835466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09962","last_updated":"2024-10-15T16:10:26Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T18:59:58Z","title":"LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09962","snapshot_observed_at":"2026-08-07T23:35:42.814464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.814464Z"},"links":{"cited_paper":"/paper/2410.09962","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0b5ff1d468664f4b9749968b624d917ec3651bf336367d286a2b23fcd4bac418","observation_id":"01e16b8e-c3f9-4db7-b028-afd108b7d7fe","resolution":{"observed_at":"2026-08-07T23:35:42.814464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.13948","last_updated":"2022-07-28T08:28:09Z","snapshot_observed_at":"2026-07-06T13:36:14.246767Z","submitted_at":"2022-07-28T08:28:09Z","title":"An Interpretability Evaluation Benchmark for Pre-trained Language Models","version":1},"cited_work":{"arxiv_id":"2207.13948","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.13948","snapshot_observed_at":"2026-08-07T23:35:43.255695Z","title":"An Interpretability Evaluation Benchmark for Pre-trained Language Models","venue":"cs.CL","work_id":"c51bea4b-d53b-4b6e-99da-9d96796ccefc","year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.841478Z"},"links":{"cited_paper":"/paper/2207.13948","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:e7f9f6274c0bcadce53fd5fa46ece9d0c72e3dec39dc978afa64128bfefb8e05","observation_id":"5f764ef2-c647-432d-b8c1-e4e3a3f9e7d0","resolution":{"observed_at":"2026-08-07T23:35:43.259889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-07T23:35:42.820557Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.820557Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4e18b654d4b1ef56065c2cd5ccbb0faa9d58c20764ee3d5e8fe423bb3c26a976","observation_id":"5e1c44a6-b37c-4e66-a242-719aa6949594","resolution":{"observed_at":"2026-08-07T23:35:42.820557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.847446Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.847446Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b50435fa4dd4cfccbd7897762b9270defc82cef8396118a6fb367affa2fefbd8","observation_id":"781e5b33-a901-4679-8be3-d59c8d9d1e48","resolution":{"observed_at":"2026-08-07T23:35:42.847446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.826508Z","title":"In Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing , Jian Su, Kevin Duh, and Xavier Car- reras (Eds.)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.826508Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4f5494893f5056a4ac567bda6eb49feb176289030f7036016e50b0f4871c9767","observation_id":"4bd856cc-13c9-4883-9f6b-0f6a181f49bb","resolution":{"observed_at":"2026-08-07T23:35:42.826508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.852413Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.852413Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:824afbdba1a24d89149501951ede3060f00c3e675253512b43215a605b3acd1d","observation_id":"3a20dc31-a722-4aef-8497-83847d01c642","resolution":{"observed_at":"2026-08-07T23:35:42.852413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.854802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.854802Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:1337808b0891adfbeccdecfe0845389289d992a6d6e2c6b5af9a9980627abdfc","observation_id":"70765af2-18bd-473d-ab69-26c73a29e4ad","resolution":{"observed_at":"2026-08-07T23:35:42.854802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T23:35:42.856940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.856940Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:8d560a9cb38710a39b7edccb73872797ebc95ce2f2d11a5611d1759c2c7d4c77","observation_id":"d7c248df-e0b5-46e8-a888-d41c432aec1b","resolution":{"observed_at":"2026-08-07T23:35:42.856940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12872","last_updated":"2024-07-15T12:15:08Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-15T12:15:08Z","title":"Evaluating Large Language Models with fmeval","version":1},"cited_work":{"arxiv_id":"2407.12872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12872","snapshot_observed_at":"2026-08-07T23:35:43.268689Z","title":"Evaluating Large Language Models with fmeval","venue":"cs.CL","work_id":"cfabd0bb-44a7-4e5c-83ca-b25613ddac37","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.838370Z"},"links":{"cited_paper":"/paper/2407.12872","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:9cf67f193b75fd3e96926c2f85b12b54e79346b2480b549d28c6d1b910e3826e","observation_id":"eb1aeec2-bb7d-4074-a21e-c13535ff7ecc","resolution":{"observed_at":"2026-08-07T23:35:43.272176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-07T23:35:42.863898Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.863898Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:0e4fd84e2d37a4d99cbe4b4f1bc3c467cb575b4285b49fb02a348341bb98409b","observation_id":"e5469b24-71e6-4831-9b20-84825d9d63c7","resolution":{"observed_at":"2026-08-07T23:35:42.863898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.844395Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.844395Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c9b5820ad182dba0bf5cd968f043f424a65238dbd8990c83202fdcc477aa41af","observation_id":"6bd40893-61f8-4de3-ae64-01645250aaba","resolution":{"observed_at":"2026-08-07T23:35:42.844395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11698","last_updated":"2024-02-26T20:41:01Z","snapshot_observed_at":"2026-08-07T02:34:39.980213Z","submitted_at":"2023-06-20T17:24:23Z","title":"DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11698","snapshot_observed_at":"2026-08-07T23:35:42.869827Z","title":"Truong, Simran Arora, Mantas Mazeika, Dan Hendrycks, Zinan Lin, Yu Cheng, Sanmi Koyejo, Dawn Song, and Bo Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.869827Z"},"links":{"cited_paper":"/paper/2306.11698","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:63eac86b705a01217d7d4e7cf84fcec071dab676b7e3a7a9c26060b0c59d171b","observation_id":"0955883b-c37d-4f8a-a42f-19e68cc01e40","resolution":{"observed_at":"2026-08-07T23:35:42.869827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13338","last_updated":"2024-08-23T19:12:45Z","snapshot_observed_at":"2026-07-06T19:05:18.260091Z","submitted_at":"2024-08-23T19:12:45Z","title":"LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models","version":1},"cited_work":{"arxiv_id":"2408.13338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13338","snapshot_observed_at":"2026-08-07T23:35:43.241106Z","title":"LalaEval: A Holistic Human Evaluation Framework for Domain-Specific Large Language Models","venue":"cs.HC","work_id":"1233b1e4-0bf5-48a7-9df6-6917ae5c37b3","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.849901Z"},"links":{"cited_paper":"/paper/2408.13338","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:8045b521af8d90434f5bd308e8f15d71677498d49fe7fdb2e590f96d40f42481","observation_id":"9dab2ad0-c7f6-4b39-8ac3-479ce16c67f5","resolution":{"observed_at":"2026-08-07T23:35:43.246503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-07T23:35:42.876049Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.876049Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:4698d6e88139a27af756ae651d6ee9a12d1006d864690c8048a0a09c889b7648","observation_id":"3e92f87e-2686-455f-83f1-4bca005cd247","resolution":{"observed_at":"2026-08-07T23:35:42.876049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02210","last_updated":"2023-10-24T14:00:21Z","snapshot_observed_at":"2026-07-06T15:12:22.395669Z","submitted_at":"2023-04-05T03:49:06Z","title":"Document-Level Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02210","snapshot_observed_at":"2026-08-07T23:35:42.879026Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.879026Z"},"links":{"cited_paper":"/paper/2304.02210","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a19d726380d96eeb68b1e22f2dddafbec25a49503d03ff0768ab3cbdd20c7a3e","observation_id":"b31ecd82-ff6f-4bce-8643-30eec429bcf5","resolution":{"observed_at":"2026-08-07T23:35:42.879026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.882205Z","title":"Smith, and Teruko Mitamura","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.882205Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:21bdc24bcb770107ca3eef769cf2e2d2d14129a42b474cfa1b91e3d65a0aba8d","observation_id":"58fd2708-310c-406b-a025-44a2c6c04a52","resolution":{"observed_at":"2026-08-07T23:35:42.882205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.859441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.859441Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:cc6ba1ba9da9d759f65068fa5bd0228594dca2144fa09c1865d3900c0df31878","observation_id":"5df30076-7d26-4ce6-8d0c-9d2f199cec50","resolution":{"observed_at":"2026-08-07T23:35:42.859441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.861678Z","title":"Advances in Neural Information Processing Systems 36 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.861678Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b8360d78fe09fb0f70d73cd73b75555a46a4f29e0e25a7576306769f655a6ff1","observation_id":"6ce5459a-8839-4d48-9da7-b3cf16f2b55f","resolution":{"observed_at":"2026-08-07T23:35:42.861678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13704","last_updated":"2025-02-25T01:51:06Z","snapshot_observed_at":"2026-07-06T19:05:36.210400Z","submitted_at":"2024-08-25T02:01:38Z","title":"DHP Benchmark: Are LLMs Good NLG Evaluators?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13704","snapshot_observed_at":"2026-08-07T23:35:42.891112Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.891112Z"},"links":{"cited_paper":"/paper/2408.13704","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:6439bbbf1977bd6369a0a4a2d2466b77b269bf30a8293363deeacb8eacf1e035","observation_id":"ba2eda73-8fe5-4972-a8bd-8add8a617f16","resolution":{"observed_at":"2026-08-07T23:35:42.891112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.867035Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.867035Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a2a4328d475296be95171f60bd9cbc0abf739805d63a6ae52662713985d70d59","observation_id":"43dc27af-db77-471d-9052-f793109c05f7","resolution":{"observed_at":"2026-08-07T23:35:42.867035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05426","last_updated":"2018-02-19T19:19:51Z","snapshot_observed_at":"2026-08-08T22:26:58.590242Z","submitted_at":"2017-04-18T17:10:13Z","title":"A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05426","snapshot_observed_at":"2026-08-07T23:35:42.897234Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.897234Z"},"links":{"cited_paper":"/paper/1704.05426","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:01747f684c56151e30989492789bfb82fa745ce036e52a78697bb0cd0731886e","observation_id":"6fd23ec5-6389-4d9a-92ee-cd3f27240be0","resolution":{"observed_at":"2026-08-07T23:35:42.897234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02840","last_updated":"2022-01-10T06:05:16Z","snapshot_observed_at":"2026-07-06T12:05:25.336577Z","submitted_at":"2021-11-04T12:59:55Z","title":"Adversarial GLUE: A Multi-Task Benchmark for Robustness Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02840","snapshot_observed_at":"2026-08-07T23:35:42.872968Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.872968Z"},"links":{"cited_paper":"/paper/2111.02840","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:392dd752cab937d32a64f3b3c251dd6ef7ce75f7d0b0811a12510852418120a2","observation_id":"51a6cad7-7eab-4dbe-9466-5731b9e54fb6","resolution":{"observed_at":"2026-08-07T23:35:42.872968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.595506Z","title":null,"venue":null,"work_id":"3d831d4e-14c8-48ee-aaef-560235610463","year":null},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.903121Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b21fe2513c5884f8b4d031bc740984dfa1433eca8bbb03e0743f3707a0cb1dfc","observation_id":"6b7b782d-e3d9-49aa-8842-b8816314797e","resolution":{"observed_at":"2026-08-07T23:35:43.598649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.586834Z","title":null,"venue":null,"work_id":"01e3c28d-93f8-43db-9a83-c4334207b0e2","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.909203Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:a1830b0f8dd2d289ac5283312112963384bb6596172ee3ef29903fcf62642d62","observation_id":"10a31815-2774-45dd-9871-f3e508c4e89f","resolution":{"observed_at":"2026-08-07T23:35:43.589935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10019","last_updated":"2024-10-05T06:50:15Z","snapshot_observed_at":"2026-08-06T04:21:24.397587Z","submitted_at":"2024-01-18T14:40:46Z","title":"R-Judge: Benchmarking Safety Risk Awareness for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10019","snapshot_observed_at":"2026-08-07T23:35:42.912130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.912130Z"},"links":{"cited_paper":"/paper/2401.10019","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:44f9e46ceaf61bd1b8510bb8e4d21a8fa761ba1fe25c1417ba80cccdd39bb1be","observation_id":"2639926f-7a1a-44a4-bd2a-1327389db7fa","resolution":{"observed_at":"2026-08-07T23:35:42.912130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:42.885080Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.885080Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:c7bf55b3043c16ab751605472abb365086f859a66c441fee11d0a6cf20a1b88e","observation_id":"a40c18e0-4c67-4b32-bd52-1fb541fbcbcf","resolution":{"observed_at":"2026-08-07T23:35:42.885080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1304.6480","last_updated":"2013-04-24T04:08:23Z","snapshot_observed_at":"2026-07-06T03:11:51.813034Z","submitted_at":"2013-04-24T04:08:23Z","title":"A Theoretical Analysis of NDCG Type Ranking Measures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1304.6480","snapshot_observed_at":"2026-08-07T23:35:42.887915Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.887915Z"},"links":{"cited_paper":"/paper/1304.6480","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:47254bc66da5aef6ea9a36aadc1bc8d45dfad2657ae234be7faae4a450705822","observation_id":"ffce3c16-92b4-40d9-a5a9-e9114ee65dc5","resolution":{"observed_at":"2026-08-07T23:35:42.887915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.578058Z","title":null,"venue":null,"work_id":"41213ce9-8bb5-46b2-9247-330cba0634a7","year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.922646Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:35c06534a651b148e3f47ad8a3fb132911e676699a2ef83f80b0539cb61f1c2c","observation_id":"8a072e5a-e6ea-4d15-8dcd-93e24a914f35","resolution":{"observed_at":"2026-08-07T23:35:43.581098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-07T23:35:42.894068Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.894068Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:61ed7777117991b6a4bc89b75909acdc92441b1b8f6bb9ecdacb55e101e542a0","observation_id":"9ea7a298-1b5d-4e66-81fa-4c2d9a97de88","resolution":{"observed_at":"2026-08-07T23:35:42.894068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-07T23:35:42.927960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.927960Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:6aaf7b1930174847521cd243f52129ee025d5d8681bb1bc319324f64324dee9e","observation_id":"defb6ea1-6aed-4bd9-b8e7-c2bba422d85b","resolution":{"observed_at":"2026-08-07T23:35:42.927960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:35:43.604019Z","title":null,"venue":null,"work_id":"9c859881-8695-41e0-863a-27bd0efcd057","year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.900246Z"},"links":{"citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:dcdc5bd3ee1818d8515e1846fbdbaabc4f70dbce979ee533138f234788b147cd","observation_id":"3a059a11-00b6-45aa-9180-3e42089465e4","resolution":{"observed_at":"2026-08-07T23:35:43.606460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.06724","last_updated":"2015-06-22T19:26:56Z","snapshot_observed_at":"2026-08-06T16:37:38.107677Z","submitted_at":"2015-06-22T19:26:56Z","title":"Aligning Books and Movies: Towards Story-like Visual Explanations by Watching Movies and Reading Books","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.06724","snapshot_observed_at":"2026-08-07T23:35:42.932998Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.932998Z"},"links":{"cited_paper":"/paper/1506.06724","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:f8f0e15f9eda75680556269c8bcc73201bd94df43f44b959db6b85d9fc53bce4","observation_id":"4c8835d8-bdec-40c5-981d-85d628bf4a3b","resolution":{"observed_at":"2026-08-07T23:35:42.932998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11805","last_updated":"2024-03-18T14:03:23Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:03:23Z","title":"LLM as a System Service on Mobile Devices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11805","snapshot_observed_at":"2026-08-07T23:35:42.905965Z","title":"arXiv preprint arXiv:2403.11805 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.905965Z"},"links":{"cited_paper":"/paper/2403.11805","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:b13d5d6d62831f7c368b77bf8c5b7dd816311c9430bbbeea0992c033de97cd13","observation_id":"32c74742-06d8-4d11-b2cf-0bad6dd002e1","resolution":{"observed_at":"2026-08-07T23:35:42.905965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T08:58:06.881734Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":92,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 3 inbound Pith citation observations for arXiv:2502.09670."}