{"as_of":"2026-08-09T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f913da717486571830754ef60f796a773cb494860be1a9dfe5a609fbf2066f15","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T13:23:25.998584Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:46:02.023365Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"cited_work":{"arxiv_id":"2605.23909","doi":"10.48550/arxiv.2605.23909","metadata_source":"pith","pith_arxiv_id":"2605.23909","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Confidence Calibration in Large Language Models","venue":"cs.AI","work_id":"4a5ac602-e403-479c-9642-f9dd3d559932","year":2026},"citing_paper":{"arxiv_id":"2607.15647","last_updated":"2026-07-17T05:45:02Z","snapshot_observed_at":"2026-08-07T11:02:35.131681Z","submitted_at":"2026-07-17T05:45:02Z","title":"Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T22:46:02.023365Z"},"links":{"cited_paper":"/paper/2605.23909","citing_paper":"/paper/2607.15647"},"observation_digest":"sha256:c78d3134fdbc3d6778189281218155071a2cc29222764ac997704e945753ad5f","observation_id":"c08ee2c7-56df-4e05-8858-90b412ecf3b2","resolution":{"observed_at":"2026-08-01T22:48:43.408499Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.23909/citation-record","integrity":"/paper/2605.23909/integrity","json":"/paper/2605.23909/citation-record.json","paper":"/paper/2605.23909"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2011.06225","last_updated":"2021-01-06T01:58:12Z","snapshot_observed_at":"2026-07-06T10:13:57.236233Z","submitted_at":"2020-11-12T06:41:05Z","title":"A Review of Uncertainty Quantification in Deep Learning: Techniques, Applications and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.06225","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv: 2011.06225","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2011.06225","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:0909eefd37b40666ceb09543e03b25de9e59eb928ba2765c40381e416eb68c11","observation_id":"3bb1368b-8637-42bd-8fea-4bd2c46109f8","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Christopher Clark, Kenton Lee, Ming-Wei Chang, Tom Kwiatkowski, Michael Collins, and Kristina Toutanova","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:28cad7bcf68d3bf46786bd5a1ed30008524a1a9b18838b937718f6af3d797124","observation_id":"f17d7937-dc3a-4ff7-acbc-1a3d5286361f","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:3a8841a51fc2f107197256d86f554ea708d2a4099417444e66586bb78fdf1301","observation_id":"ed143514-84d3-438f-9bbe-90b5e7a1ef07","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14453","last_updated":"2024-02-22T11:16:23Z","snapshot_observed_at":"2026-07-06T17:33:54.693207Z","submitted_at":"2024-02-22T11:16:23Z","title":"Do LLMs Implicitly Determine the Suitable Text Difficulty for Users?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14453","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2402.14453","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:7f655a09e4c5ebca15ea7c1f857c91b9b1196b3836a08ab814d827a54e9a93ec","observation_id":"1a1ef2c0-ac61-409b-a64e-69803af5b3c1","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-07T08:05:23.979918Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Irene Hou, Hannah Vy Nguyen, Owen Man, and Stephen MacNeil","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:02503ebfe152d02b55586fe41a1638c60f75e44b13b36df7a66e137a9a8c9ba2","observation_id":"e07311e7-fc2b-46db-b7b9-d8fe1c409e19","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"InProceedings of the 56th ACM Technical Symposium on Computer Science Education V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:3180f0ae11a11b5497312bf975e92bbd4a07fdd213aa8e7e4eb80b839e8d918e","observation_id":"bc9285a3-efde-4c96-b9c2-73009a49c621","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.25064","last_updated":"2026-05-19T03:31:14Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-29T01:07:26Z","title":"Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.25064","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2510.25064","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:6e5c7f7485ffb03eb39f2bc9733136b60de7461325186e2f85f5a103394ff838","observation_id":"bad2fab0-8ad3-4381-b40a-30cfbb823d6d","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv:2207.05221 [cs]","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:d98aef22f65615f14db8b85e405efbc638935642e510eb2653b3b6bb222ddb7c","observation_id":"2cf8fc05-6147-4117-842d-0113394201a8","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Preprint, arXiv:2509.04664","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:3247c22041fcd7c0593488378c1bd8f65662648d0cb085d13a22544ed70f2b52","observation_id":"39db4301-d476-4c17-9ad8-11ad53e2a37c","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09724","last_updated":"2025-02-28T23:36:40Z","snapshot_observed_at":"2026-07-06T19:32:28.772012Z","submitted_at":"2024-10-13T04:48:40Z","title":"Taming Overconfidence in LLMs: Reward Calibration in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09724","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv:2410.09724 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2410.09724","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:e3ac789e015275d8004f6210bb826be7aa0d89a03bbad3c707b9f38dfc42e657","observation_id":"c77dc202-54d1-4fe5-b38e-618c19b8e9aa","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Sarah Lichtenstein and Baruch Fischhoff","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:2ea0e9f86385d4be7c90ca9043c2f2ce22216ce49ba82f0b442cfab186e8220d","observation_id":"aaed1cd9-d46e-486d-a891-31a5b4da21b8","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:b8881aa5dae173526af129a9418706be2f94a335bc5f2068c6b0141b6f2dcb8e","observation_id":"8757ac57-c559-4823-82e4-01723cbc4ee2","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04026","last_updated":"2020-03-09T10:30:28Z","snapshot_observed_at":"2026-08-03T11:27:31.436340Z","submitted_at":"2020-03-09T10:30:28Z","title":"When are Bayesian model probabilities overconfident?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04026","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv: 2003.04026","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2003.04026","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:e8db0e0fa8863972a82f18104290b48a284cf0fc852a23f27f5b8264c678ecae","observation_id":"0b4ebb65-9591-4c6a-81d9-b03d351a3933","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19047","last_updated":"2025-09-12T18:31:29Z","snapshot_observed_at":"2026-07-06T20:28:57.453439Z","submitted_at":"2025-01-31T11:18:45Z","title":"Understanding Model Calibration -- A gentle introduction and visual exploration of calibration and the expected calibration error (ECE)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19047","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Philip and Hemang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2501.19047","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:2e6381b7d50ad30f4805e7a64a158c473eae92c5ec6958afa6040ebb32c01cd2","observation_id":"8e9e26c0-1259-44d9-8d52-67e7696efd72","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Web page","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:df32b0659cffaa98b543dcfa578363b1272f6fd836c63cf285cffb50209a0da0","observation_id":"377f3949-5341-42fb-a312-9654d38ea0d8","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19684","last_updated":"2025-02-27T01:51:45Z","snapshot_observed_at":"2026-08-07T17:44:25.185174Z","submitted_at":"2025-02-27T01:51:45Z","title":"GRACE: A Granular Benchmark for Evaluating Model Calibration against Human Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19684","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2502.19684","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:a8390913da094e1ea59a7654e46f22011828a8f26af508014a50d71dbb224a1f","observation_id":"78c615ca-479a-4ca0-8ba3-5a52ab9fc33c","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Katherine Tian, Eric Mitchell, Allan Zhou, Archit Sharma, Rafael Rafailov, Huaxiu Yao, Chelsea Finn, and Christo- pher D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:ba1d7cd0deda0c25ccc71a86ef7a39c1c6c66c2666d445db168679c14cbfbe70","observation_id":"d31f1d48-005f-4085-8e42-7ad2cafb3e90","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-08T18:32:07.349868Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Sahil Tripathi, Md Tabrez Nafis, Imran Hussain, and Jiechao Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:0e7a3b2265010a7a2f0345a30f4095e28014ae22ae00b0405bd1801bf3ec680e","observation_id":"c4f7439e-d337-448d-8cf7-f44492eb1078","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv:2506.23464 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:37515955212962237276710812dd5be923f4f33d66abe0c178fcc2808b122dbe","observation_id":"ef494730-f362-44a7-bf5e-2940ada56aa8","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-06T06:05:27.671303Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv:1707.06209 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:3fcfe2210e13a2565c02bc6674674c4e852887105ce7e28148f85900036c1364","observation_id":"77190e65-a272-4f00-8c38-62441e58fe05","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"ArXiv:2505.01997 [cs]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:641f7c042b3626d7905ed68477460509ed4fbcadd61f9d34d64c31c7fb833eb2","observation_id":"65038dd5-d727-406b-8cf7-2ea4e468fde1","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Chenjun Xu, Bingbing Wen, Bin Han, Robert Wolfe, Lucy Lu Wang, and Bill Howe","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:127b791e47febbc40b0c139cff298af1b93fdf7978246037abb48f970149efae","observation_id":"212fface-ed7d-47e1-bc23-d93c823bcc6d","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00582","last_updated":"2025-07-28T12:59:13Z","snapshot_observed_at":"2026-08-08T15:08:29.493366Z","submitted_at":"2025-05-31T14:37:18Z","title":"Do Language Models Mirror Human Confidence? Exploring Psychological Insights to Address Overconfidence in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00582","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Wanjun Zhong, Ruixiang Cui, Yiduo Guo, Yaobo Liang, Shuai Lu, Yanlin Wang, Amin Saied, Weizhu Chen, and Nan Duan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2506.00582","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:0a55f698cbbc8df19f479ba41e48f950906dc62fda0dec30be514beebdd4b1da","observation_id":"8e44e662-0984-45c6-9ca1-bdd9020e8207","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Wanjun Zhong, Siyuan Wang, Duyu Tang, Zenan Xu, Daya Guo, Jiahai Wang, Jian Yin, Ming Zhou, and Nan Duan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:2d6a2168c1ef12bad210a0097a8c99ae003f82a6110161815321863035e5e250","observation_id":"572da502-e57c-4723-8c76-364e78efbe62","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.06598","last_updated":"2021-04-15T02:21:45Z","snapshot_observed_at":"2026-08-09T03:58:03.718727Z","submitted_at":"2021-04-14T02:53:32Z","title":"AR-LSAT: Investigating Analytical Reasoning of Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.06598","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"within true range","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2104.06598","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:4fd75584d09d871c33261745ed7b3bf7676bf7e097ca2e0bfe8eb439c3290216","observation_id":"de24ed61-024e-45bf-b294-624b5215f3ca","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:f25770381019f6cf46b5d0af72521c619b510db9a0334d4f5bb496700f2acb2b","observation_id":"2e5dabe9-470e-4ffd-b9fa-fd600f0cc18e","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T07:54:06.703604Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2605.23909."}