{"as_of":"2026-08-18T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:435b8ce2c47f9f27ed2f8715378a2a353cdca13a3931a91efc55c3deeeecd7d4","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:28:07.694891Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.12148/citation-record","integrity":"/paper/2412.12148/integrity","json":"/paper/2412.12148/citation-record.json","paper":"/paper/2412.12148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.168639Z","title":null,"venue":null,"work_id":"58515a0b-331e-457e-ac45-91bdcb44894f","year":2023},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.562968Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:18a9217edfa124b9a1508fd61665ac5e05af319dc6bc745935e49c0a5fa43c9d","observation_id":"f3bb506b-d45a-49b6-bfac-48d4cf5cdddc","resolution":{"observed_at":"2026-08-11T18:28:08.173739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.151331Z","title":null,"venue":null,"work_id":"0c460893-5493-44f4-b4b2-7c8f0d516b58","year":2023},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.569952Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:9079bb595dbb6667b2856c9bbbbcd9147fee60af4fda28060c1269266b7b4b82","observation_id":"5e58eb0f-7d6b-43fd-8cf8-d42d5175667b","resolution":{"observed_at":"2026-08-11T18:28:08.156813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.132299Z","title":null,"venue":null,"work_id":"152a6a67-75a6-411e-b729-75517a7ada82","year":2021},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.576475Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:806845752b1872d653c2bb278cfabb6f5271106a842c7bebd64430f5910f2fdd","observation_id":"0ba46453-5a63-4fe7-aab1-0d792bef343e","resolution":{"observed_at":"2026-08-11T18:28:08.138699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.113957Z","title":null,"venue":null,"work_id":"aa78a172-05bf-4624-be00-ec7bae328f05","year":2017},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.582534Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:785131a2c9bfc8492df9de86b5bdd0148c7a24b2a44ff640d8f3c5452bedd696","observation_id":"b81dd38c-b15a-45c4-a8cf-67a4d587af63","resolution":{"observed_at":"2026-08-11T18:28:08.119292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-13T16:22:14.977210Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-11T18:28:07.588952Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.588952Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:da051fd3cb3f9c14ba1272294493971c5d6b222bc50cde6679adb2a1679f5c82","observation_id":"3fff6ead-01b6-4366-8863-cb38d428b2c5","resolution":{"observed_at":"2026-08-11T18:28:07.588952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-08-17T07:14:41.768935Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-11T18:28:07.594727Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.594727Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:e43f915b8fc47c653e895dcd77098b29b63da19a507e72daf97d866f6329e16f","observation_id":"eb47dc57-1fd4-4f9c-b3c6-e33711b03902","resolution":{"observed_at":"2026-08-11T18:28:07.594727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.095441Z","title":null,"venue":null,"work_id":"f373e9e4-0805-4283-a434-a476bdab458a","year":2009},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.601099Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:b3dd2790b53ab8ceed2d01b059104360437212d0d76caa0a856bac97b37b6db0","observation_id":"e02c04f2-5e3f-47ba-ac7c-89a83377571d","resolution":{"observed_at":"2026-08-11T18:28:08.101417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.077681Z","title":null,"venue":null,"work_id":"39972901-e4e3-416f-b4ee-7f4ec89c2051","year":2017},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.606323Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:eed24fd6f405b5ebb34799baae9463cf8d24c94adf2b244448301f0f595e0476","observation_id":"7296a313-9e75-436e-a812-d1d5c460db69","resolution":{"observed_at":"2026-08-11T18:28:08.083104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.059872Z","title":"Kahneman and A","venue":null,"work_id":"142f51b7-d71e-472b-b850-72408567915e","year":2013},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.611655Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:7782e6c65cb1b2207635d108a2df58fcf023cc1fa4d79a71c7273f8304272448","observation_id":"d1f8baa9-04c5-432a-a968-d13a19e7ae84","resolution":{"observed_at":"2026-08-11T18:28:08.065298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.042240Z","title":"Lewis, E","venue":null,"work_id":"8b80900a-5214-4a1e-a86f-901f8cad06f6","year":2020},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.617773Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:588936c42d736655e88e8ef0cffc3b911e8967edd83ca9dac1aba5b79185d49c","observation_id":"733bb6f1-130f-4143-ae1a-aebdeaee6fc4","resolution":{"observed_at":"2026-08-11T18:28:08.047617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.623216Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.623216Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:d10524b0ade38f045092c780189de28c13433095fb60b5b2eb2be7c85a7c4b74","observation_id":"23859db2-96ce-4c2a-9c71-cacfb39daed9","resolution":{"observed_at":"2026-08-11T18:28:07.623216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03344","last_updated":"2024-05-27T10:33:40Z","snapshot_observed_at":"2026-08-16T14:03:41.290767Z","submitted_at":"2024-04-04T10:18:03Z","title":"Schroedinger's Threshold: When the AUC doesn't predict Accuracy","version":2},"cited_work":{"arxiv_id":"2404.03344","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03344","snapshot_observed_at":"2026-08-11T18:28:07.823219Z","title":"Schroedinger's Threshold: When the AUC doesn't predict Accuracy","venue":"cs.CL","work_id":"ef70dcc5-ad77-4801-8264-19abe6946c87","year":2024},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.628285Z"},"links":{"cited_paper":"/paper/2404.03344","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:4d872ce67352d8a1ea43d850de38893f00d6e3e799e8ee4a323b1456db3ecbba","observation_id":"3b042821-393c-4f21-a6f7-f874576ab6c1","resolution":{"observed_at":"2026-08-11T18:28:07.830094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:08.012677Z","title":"Papineni, S","venue":null,"work_id":"2329a65f-73a5-482f-897b-9edd4c2a3620","year":2002},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.633789Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:04675d7cad4b3585115a5e82fa700ff0a61a6cbdc9830ccc2f87b5f8726003c8","observation_id":"51b4cb5d-3ae5-497c-9dcd-6db824dc4ec9","resolution":{"observed_at":"2026-08-11T18:28:08.018154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08488","last_updated":"2024-07-22T18:41:53Z","snapshot_observed_at":"2026-08-16T13:35:05.019172Z","submitted_at":"2024-07-11T13:22:17Z","title":"Lynx: An Open Source Hallucination Evaluation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08488","snapshot_observed_at":"2026-08-11T18:28:07.639164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.639164Z"},"links":{"cited_paper":"/paper/2407.08488","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:e325e9e2bb8b30d8870ce1c4606557590e0cbc71c5337bc14f22c1c9907c31f8","observation_id":"29857475-e69f-472f-8fdc-c0d4075d152f","resolution":{"observed_at":"2026-08-11T18:28:07.639164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.994081Z","title":null,"venue":null,"work_id":"3eecb98c-0546-40de-a887-f4817f5b0243","year":2011},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.645363Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:a023de0fc53318afbdb8cbdbc7041dd279fabd061402c31d40cffd2512840e67","observation_id":"c496e97b-1cc0-4598-b4b7-8b769f8a70c7","resolution":{"observed_at":"2026-08-11T18:28:08.000120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.975268Z","title":"Sadinle, J","venue":null,"work_id":"cfe0e9f9-14ad-4197-9f64-306e7b76f088","year":2019},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.650669Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:4dc69c5b0ad87974b790237a2dac69e994e060cb0dd8b53a06e64e4a3d31d517","observation_id":"30ab993c-7640-4167-bdbc-bf61a8c24055","resolution":{"observed_at":"2026-08-11T18:28:07.980494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.955893Z","title":"Sudjianto and S","venue":null,"work_id":"e84e5c03-6901-43d0-b145-c1661bf376df","year":2024},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.655865Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:e35901b7fde6e1e21cf4137a167334acfdc0d896c5f82446770bdc7ca4974884","observation_id":"53d526f2-0623-4d2f-8911-15cc65f2634e","resolution":{"observed_at":"2026-08-11T18:28:07.961691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13877","last_updated":"2024-11-10T22:09:45Z","snapshot_observed_at":"2026-08-16T13:13:15.462031Z","submitted_at":"2024-10-02T17:46:52Z","title":"Model Validation Practice in Banking: A Structured Approach for Predictive Models","version":2},"cited_work":{"arxiv_id":"2410.13877","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13877","snapshot_observed_at":"2026-08-11T18:28:07.774073Z","title":"Model Validation Practice in Banking: A Structured Approach for Predictive Models","venue":"cs.CY","work_id":"1cf4e1ef-8da3-4124-b1bb-92d897c18662","year":2024},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.660930Z"},"links":{"cited_paper":"/paper/2410.13877","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:3c8e9cf08db54e69585e26ac27224764aca85410021d0497cf310e5014806e60","observation_id":"6eb14151-9d32-47ab-9cbc-73ea88392d49","resolution":{"observed_at":"2026-08-11T18:28:07.781577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.938896Z","title":null,"venue":null,"work_id":"8c5cc8e2-60ad-4822-b355-560b261ef2f8","year":2021},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.667204Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:7fc864fb8e25015932a0b0eef287244129e4fbe4a3d9fb94094463c29b10ee5f","observation_id":"aba69b2f-b942-4418-bda1-c35b6067bebe","resolution":{"observed_at":"2026-08-11T18:28:07.943796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.921938Z","title":null,"venue":null,"work_id":"7d7dd2de-2f17-4b24-b99e-76eb3cbea3c4","year":2022},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.672619Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:965d17e5cb6d6a1e92fccc7503f46d960cee13270f5b71360db4d35f80fa2cdf","observation_id":"b9689252-f223-464d-a931-69bec90dea76","resolution":{"observed_at":"2026-08-11T18:28:07.927197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.903381Z","title":null,"venue":null,"work_id":"43b2a529-599a-4ae3-a8f5-fba9321cb1d1","year":2017},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.677809Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:acb708994b722925b8823ecde8b718253ff073e939e7f4d7dc373f57635311f0","observation_id":"849bc6f1-dea6-46b8-8762-858f124b0665","resolution":{"observed_at":"2026-08-11T18:28:07.908865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-11T18:28:07.683123Z","title":"Zhang, V","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.683123Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:b33f8cccc6bc171fc0c6ac7333d951648fb624f976425e0ab2ee4d9f7ab466bf","observation_id":"ffe5f2af-4d59-4f50-ae7e-1d1996852f6b","resolution":{"observed_at":"2026-08-11T18:28:07.683123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T18:28:07.688990Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.688990Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:114d726100b2b1ba7709450fdb08f10a30faee66bd7ee9634859bd7bcbc9ac05","observation_id":"f185a0e4-47bc-40d4-977c-439f6e5deff4","resolution":{"observed_at":"2026-08-11T18:28:07.688990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:28:07.884673Z","title":"Figure 6 further illustrates the identified thresholds across different risk tolerances, measured by the false positive rate (type I error) and precision","venue":null,"work_id":"8fe63cda-0730-47fe-99b7-7e79d2806860","year":null},"citing_paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:28:07.694891Z"},"links":{"citing_paper":"/paper/2412.12148"},"observation_digest":"sha256:d1c45ae89291a8f9ca51cbed218fce3000aa35f77a532448d51681cace4b8c75","observation_id":"f42eecd1-3171-41ef-8a36-eff732989fcc","resolution":{"observed_at":"2026-08-11T18:28:07.891001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12148","last_updated":"2024-12-10T21:57:25Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-17T16:49:31.932964Z","submitted_at":"2024-12-10T21:57:25Z","title":"How to Choose a Threshold for an Evaluation Metric for Large Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2412.12148."}