{"as_of":"2026-08-18T15:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:936021e4d6d8b9278ab47b67b8863771495538fc2d84ae75f8543f1837481fe8","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:42.412963Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:18:20.760827Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-15T18:18:20.760827Z","title":"arXiv preprint arXiv:2505.23854 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.18366","last_updated":"2026-07-06T15:29:53Z","snapshot_observed_at":"2026-08-17T20:44:52.021765Z","submitted_at":"2025-07-24T12:46:40Z","title":"Toward Efficient Uncertainty in LLMs through Evidential Knowledge Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:18:20.760827Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2507.18366"},"observation_digest":"sha256:70e1ef20ffc4af793bec032f504dd53298c70613a66fd8e5a77085cb97e4089d","observation_id":"9b3d346c-f242-49e2-a541-b5f46b7c0465","resolution":{"observed_at":"2026-08-15T18:18:20.760827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-02T20:21:55.864745Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.19262","last_updated":"2026-05-28T23:06:43Z","snapshot_observed_at":"2026-08-15T05:41:49.215217Z","submitted_at":"2026-02-26T20:52:27Z","title":"Empirical Characterization of Inference-Time Elicited Probability Transformations in Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T20:21:55.864745Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2603.19262"},"observation_digest":"sha256:29ad22942ef7e3508f69cd2e8949454ca806d3866d0e3065480076dc438ac132","observation_id":"a5ed4c11-5ded-4721-9f57-0600103d5539","resolution":{"observed_at":"2026-08-02T20:21:55.864745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-12T16:18:54.458115Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:5c4c496a746b99b2c2b72392137a2bf6a23373fe2704e64cde4f34f331200ec5","observation_id":"82d38082-ecdf-401c-8854-f51fd3962bd9","resolution":{"observed_at":"2026-05-21T09:44:05.672258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2604.19781","last_updated":"2026-03-29T20:28:00Z","snapshot_observed_at":"2026-08-11T07:02:17.485746Z","submitted_at":"2026-03-29T20:28:00Z","title":"Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:13:29.201794Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2604.19781"},"observation_digest":"sha256:14ee7881c244666ac51f9a773710637c10d83ed3a151eabc261607ab90261b7b","observation_id":"88f41d5f-8b82-49f5-9136-fcab8f089423","resolution":{"observed_at":"2026-05-14T21:17:58.469843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2605.00957","last_updated":"2026-05-01T12:49:13Z","snapshot_observed_at":"2026-08-10T21:55:31.044329Z","submitted_at":"2026-05-01T12:49:13Z","title":"\"I Don't Know\" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T18:30:03.367870Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2605.00957"},"observation_digest":"sha256:6237350194ee4bcc12827c3dc65fbbe69c80e5e6b60f7a9713f006ad6a469488","observation_id":"01f33cb2-5767-4c0b-97d4-68032e0a9035","resolution":{"observed_at":"2026-05-11T16:11:11.565452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2605.01428","last_updated":"2026-05-02T12:59:14Z","snapshot_observed_at":"2026-08-13T04:56:34.015426Z","submitted_at":"2026-05-02T12:59:14Z","title":"Hallucinations Undermine Trust; Metacognition is a Way Forward","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T14:29:54.924293Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2605.01428"},"observation_digest":"sha256:f55d9f5f0b9b0a20c576ef8ce48141938ca287bd6051e1d4e005fdd370ebeaa7","observation_id":"668e8321-cc48-42cd-af59-9e178617f734","resolution":{"observed_at":"2026-05-11T16:56:07.202112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2605.05851","last_updated":"2026-05-07T08:24:54Z","snapshot_observed_at":"2026-08-04T15:23:48.540297Z","submitted_at":"2026-05-07T08:24:54Z","title":"Hypothesis generation and updating in large language models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-08T14:43:56.125546Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2605.05851"},"observation_digest":"sha256:32154bd5f3b31d92c9a70a6897e4d4ee0424c3ba64efbb1a39c11de273d3777a","observation_id":"a9d14390-04ab-4387-9f8e-a6b2c7d95f72","resolution":{"observed_at":"2026-05-08T21:14:12.533436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-11T08:46:33.961285Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:3905a0996db5bac49a3b3418bf1c00bdcaee5a19a395592b3fb3c676ed758f6c","observation_id":"8b2a0696-382c-455e-9ead-adb525a9ae63","resolution":{"observed_at":"2026-05-13T01:57:06.021788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2605.19344","last_updated":"2026-05-30T03:12:26Z","snapshot_observed_at":"2026-08-15T15:41:18.438743Z","submitted_at":"2026-05-19T04:31:38Z","title":"Retrieval-Augmented Linguistic Calibration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:48:03.641696Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2605.19344"},"observation_digest":"sha256:8e9c7e9e611d1f31c6d6e5d1fa802c31dd29ca4e72faf73e8347c831531eb17e","observation_id":"61d0be8f-0d5f-463c-a19b-f51d597d8b84","resolution":{"observed_at":"2026-05-20T05:53:05.155542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2605.19344","last_updated":"2026-05-30T03:12:26Z","snapshot_observed_at":"2026-08-15T15:41:18.438743Z","submitted_at":"2026-05-19T04:31:38Z","title":"Retrieval-Augmented Linguistic Calibration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:36:25.106668Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2605.19344"},"observation_digest":"sha256:a71b40dc48053daae8b91a999c8ec546cd69fd92214bfde791041fba59e59a85","observation_id":"80de674f-289e-40eb-851c-90d35991b82e","resolution":{"observed_at":"2026-07-01T14:55:48.397448Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.23854","doi":"10.48550/arxiv.2505.23854","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revisiting uncertainty estimation and calibration of large language models.arXiv preprint arXiv:2505.23854","venue":"ArXiv.org","work_id":"55c6d394-22d1-4eca-97e1-0c1daed79bad","year":2025},"citing_paper":{"arxiv_id":"2606.09635","last_updated":"2026-06-08T15:33:13Z","snapshot_observed_at":"2026-08-02T03:20:14.810565Z","submitted_at":"2026-06-08T15:33:13Z","title":"Gradient-Guided Reward Optimization for Inference-time Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:04.984866Z"},"links":{"cited_paper":"/paper/2505.23854","citing_paper":"/paper/2606.09635"},"observation_digest":"sha256:d4207d58678ecd6dd7d4ab2f94a7878df37589d99067f041d07c2bd7abc7ab1e","observation_id":"e08bc5bb-8617-45de-bc2e-9a753e99e46e","resolution":{"observed_at":"2026-07-03T01:17:30.645365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23854/citation-record","integrity":"/paper/2505.23854/integrity","json":"/paper/2505.23854/citation-record.json","paper":"/paper/2505.23854"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.551868Z","title":"Large language models in medicine.Nature medicine, 29(8):1930–1940, 2023","venue":null,"work_id":null,"year":1930},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.551868Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:3b4cbf90a925b253ff953efbbfeca4dfd5cd4e645e6f0b61f2050a271e4e0ac5","observation_id":"eeabaf38-434a-4669-9f7d-f022633efb8e","resolution":{"observed_at":"2026-08-07T12:59:37.551868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:45.559154Z","title":"Adapted large language models can outperform medical experts in clinical text summa- rization.Nature medicine, 30(4):1134–1142, 2024","venue":null,"work_id":"8dcc08dd-e8d3-4548-9a40-a5bab4e853d3","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.640897Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:87ba4e237afe6aec45e306babdea31cd1bf92e95000315e7191d87bc75ccb227","observation_id":"2d07b809-04ab-4715-80f3-5b9e8016ace4","resolution":{"observed_at":"2026-08-07T12:59:45.680203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19260","last_updated":"2025-01-02T18:46:05Z","snapshot_observed_at":"2026-08-16T13:53:04.662481Z","submitted_at":"2024-12-26T15:54:10Z","title":"MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19260","snapshot_observed_at":"2026-08-07T12:59:37.703236Z","title":"Medec: A benchmark for medical error detection and correction in clinical notes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.703236Z"},"links":{"cited_paper":"/paper/2412.19260","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:7e58c5ce7d21af0290a85c7fe3171ada3d5a3ed593768cb32fdab3db2714d592","observation_id":"8e9b719b-827a-40e3-ba33-cf5c4ec82e35","resolution":{"observed_at":"2026-08-07T12:59:37.703236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:45.350033Z","title":"Large language models: a comprehensive survey of its applications, challenges, limitations, and future prospects.Authorea Preprints, 1:1–26, 2023","venue":null,"work_id":"2602c04d-597b-444a-9b2f-22a06282d7d5","year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.785893Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:15c8b317b520e3d5802dc7a7a4a234cf8790265bc1fcc6c0ad6716360adb3867","observation_id":"ca2020b9-175c-4de5-9c69-cc56cb9257dd","resolution":{"observed_at":"2026-08-07T12:59:45.466563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:37.854288Z","title":"Large language models in law: A survey.AI Open, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.854288Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:724e43b3f9d5cbbf6701134245f1f436357ac7712322a3c9ac6275110b36daed","observation_id":"ef793f4e-92f1-4cf4-8dbc-b79a16f31749","resolution":{"observed_at":"2026-08-07T12:59:37.854288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:45.096825Z","title":"Overreliance on ai literature review.Microsoft Research, 339:340, 2022","venue":null,"work_id":"48e399d1-5679-4120-bb49-42d62a17c448","year":2022},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.902306Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:a48947ac33dcc5a73998e612c5220ae123dac0407d9ed6d2d2dde8d480fb11bb","observation_id":"a4e05e20-ae7b-4b17-9782-8e6d68e26011","resolution":{"observed_at":"2026-08-07T12:59:45.228040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.886894Z","title":"Understanding the eu ai act: Requirements and next steps","venue":null,"work_id":"dea66a67-6de1-4167-bbe0-eabdb9c2a0b5","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:37.971286Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:e31980a1ab9c8e70b04ea7f9f34287dbffa86bd9d8b69c311399fe311b6482d9","observation_id":"94622b17-0103-455b-a7d1-8f179f1f1019","resolution":{"observed_at":"2026-08-07T12:59:44.987647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.675763Z","title":"Us debt ceiling deal clears major hurdle in congress, 2023","venue":null,"work_id":"9bdb11c8-d96f-4b44-b943-e7949bd5776a","year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.025559Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:693e26816fff4ed7c8aa64706b5ccb18d1ca65e51dec950542ebcffc1291cb3a","observation_id":"f0fd20b6-0dbe-4484-8034-a5adc2f6d468","resolution":{"observed_at":"2026-08-07T12:59:44.776735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.500177Z","title":"Shifting attention to relevance: Towards the uncertainty estimation of large language models","venue":null,"work_id":"4c2befdb-5138-40b3-acc4-6b88f22df12f","year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.065319Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:864ab4e53514956599bd4d1e4c85301cbb2b2bf7dcf60ac880434b42a1083446","observation_id":"3d7996eb-a9ad-476e-b359-4d2f55243ef6","resolution":{"observed_at":"2026-08-07T12:59:44.558433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.345080Z","title":"Semantic calibration of llms through the lens of temperature scaling","venue":null,"work_id":"938e3523-3eab-4cea-b584-6a44e7566d01","year":null},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.132286Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:d870b5d9db53b0e596f754c70bbdc45fca0f248bac14936359e71882c87b2a98","observation_id":"ef2ee3bb-1ceb-49ee-8c0a-39e3a8832012","resolution":{"observed_at":"2026-08-07T12:59:44.398144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15927","last_updated":"2024-06-22T19:46:06Z","snapshot_observed_at":"2026-07-30T04:59:24.269176Z","submitted_at":"2024-06-22T19:46:06Z","title":"Semantic Entropy Probes: Robust and Cheap Hallucination Detection in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15927","snapshot_observed_at":"2026-08-07T12:59:38.199784Z","title":"Semantic entropy probes: Robust and cheap hallucination detection in llms.arXiv preprint arXiv:2406.15927, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.199784Z"},"links":{"cited_paper":"/paper/2406.15927","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:52e0a0f0445673e6e93e2a27a81c408137d8f9f55b3a359a113a0fb84bb66bfb","observation_id":"7483b66a-e019-446d-9bc9-30d7cf093fe1","resolution":{"observed_at":"2026-08-07T12:59:38.199784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14477","last_updated":"2025-04-22T19:00:41Z","snapshot_observed_at":"2026-08-16T12:48:53.597735Z","submitted_at":"2025-03-18T17:51:04Z","title":"Calibrating Verbal Uncertainty as a Linear Feature to Reduce Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14477","snapshot_observed_at":"2026-08-07T12:59:38.252917Z","title":"Calibrating verbal uncertainty as a linear feature to reduce hallucinations.arXiv preprint arXiv:2503.14477, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.252917Z"},"links":{"cited_paper":"/paper/2503.14477","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:2ff2436edf7d059f5d7108172f6f15bb0ec95d8ba74e45e1023faa1612ab66a3","observation_id":"20371349-ad3e-46d9-b448-97107aaabb35","resolution":{"observed_at":"2026-08-07T12:59:38.252917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:38.316495Z","title":"Mitigating object hallucinations in large vision-language models via attention calibration.arXiv preprint arXiv:2502.01969, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.316495Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:d09d887e5481781d2b1b44591eaa2fe3875b80fa24f96855f685e37492f07b99","observation_id":"d9a07837-1993-4910-bdd7-8388a21795f8","resolution":{"observed_at":"2026-08-07T12:59:38.316495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-07T12:59:38.390328Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.390328Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:21bed7c0545bf9beb7c293deeb4f4a94da31456faba9b981e443501fc92c62df","observation_id":"9d820e3e-20a4-4080-9559-74e1ee58c031","resolution":{"observed_at":"2026-08-07T12:59:38.390328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08896","snapshot_observed_at":"2026-08-07T12:59:38.513072Z","title":"Selfcheckgpt: Zero-resource black-box hallucination detection for generative large language models.arXiv preprint arXiv:2303.08896, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.513072Z"},"links":{"cited_paper":"/paper/2303.08896","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:d0783d675c6cb0dfb49f87ee448429a757b6cb7b256593c5881004759939b0af","observation_id":"daf4f791-7a66-4312-9dd6-51f8d5645d6a","resolution":{"observed_at":"2026-08-07T12:59:38.513072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14975","last_updated":"2023-10-24T04:27:42Z","snapshot_observed_at":"2026-08-16T15:30:14.441511Z","submitted_at":"2023-05-24T10:12:33Z","title":"Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14975","snapshot_observed_at":"2026-08-07T12:59:38.624582Z","title":"Just ask for calibration: Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback.arXiv preprint arXiv:2305.14975, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.624582Z"},"links":{"cited_paper":"/paper/2305.14975","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:6ba40ea54e15c036dd3a901097ed9c1dcb9632b92697ef87fb522cc2ba3c62e2","observation_id":"1da2abeb-136f-4094-a287-a324fe04db61","resolution":{"observed_at":"2026-08-07T12:59:38.624582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-08-15T10:58:51.256503Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-07T12:59:38.714851Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.714851Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:bbde910102290cb4fa30f9c0c962a6e0be20bc983905b081d6b8adc76524505a","observation_id":"3252f1ca-9b54-4095-9185-67ba89f5ccee","resolution":{"observed_at":"2026-08-07T12:59:38.714851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16908","last_updated":"2024-09-26T08:53:01Z","snapshot_observed_at":"2026-08-16T16:45:13.843152Z","submitted_at":"2024-05-27T07:56:23Z","title":"Can Large Language Models Faithfully Express Their Intrinsic Uncertainty in Words?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16908","snapshot_observed_at":"2026-08-07T12:59:38.828049Z","title":"Can large language models faithfully express their intrinsic uncertainty in words?arXiv preprint arXiv:2405.16908, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.828049Z"},"links":{"cited_paper":"/paper/2405.16908","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:d5a948951739d9c91174b45d874d7fb2eb1c97eb1e52b7bb0e95b3077bdeb474","observation_id":"46d5145c-d84e-4cc8-8d54-ac61ca9238c7","resolution":{"observed_at":"2026-08-07T12:59:38.828049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15814","last_updated":"2024-11-07T17:33:37Z","snapshot_observed_at":"2026-08-18T05:04:40.425153Z","submitted_at":"2024-07-22T17:26:12Z","title":"Perceptions of Linguistic Uncertainty by Language Models and Humans","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15814","snapshot_observed_at":"2026-08-07T12:59:38.924855Z","title":"Perceptions of linguistic uncertainty by language models and humans.arXiv preprint arXiv:2407.15814, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:38.924855Z"},"links":{"cited_paper":"/paper/2407.15814","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:1f90e1a606dc26fa49b76421222caaea5c25be651bd1aa7f059c8713bac82459","observation_id":"040bf658-455f-4dcf-a43a-841e691046fb","resolution":{"observed_at":"2026-08-07T12:59:38.924855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13240","last_updated":"2023-11-22T08:57:55Z","snapshot_observed_at":"2026-08-16T14:41:14.874842Z","submitted_at":"2023-11-22T08:57:55Z","title":"On the Calibration of Large Language Models and Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13240","snapshot_observed_at":"2026-08-07T12:59:39.079405Z","title":"On the calibration of large language models and alignment.arXiv preprint arXiv:2311.13240, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.079405Z"},"links":{"cited_paper":"/paper/2311.13240","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:f8ffe73bcd6f77a5a739b1f46dde946b5db35f0cb793f57b0bc055eb5d29ed66","observation_id":"561c4e14-e924-45c8-ab52-42a5b1aa0943","resolution":{"observed_at":"2026-08-07T12:59:39.079405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:59:39.166999Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.166999Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:8c4e9d600773decc34956bfc9128b1e1ef449aff8fb7ca8ec6bfeabe2f1d6480","observation_id":"43492b8e-c07c-4c8a-a7c6-b8881390c9fd","resolution":{"observed_at":"2026-08-07T12:59:39.166999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.260512Z","title":"Qwen2 and qwen3: The new generation open models.https://qwenlm.github","venue":null,"work_id":"eab9b3cc-7d0f-4177-b360-3e8fd1edc8f0","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.236785Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:ef5d2f115a9053f268004e8925529c4a5f2c74e58ecaa7724e4e17f1de62b8f8","observation_id":"feced0d8-d9af-428f-9ed7-f4f812140968","resolution":{"observed_at":"2026-08-07T12:59:44.275222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.187948Z","title":"Llama 4: Multimodal intelligence","venue":null,"work_id":"2c0e1c86-2d8b-46fd-b68a-a13f18495a18","year":2025},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.357994Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:b269494a46140d7271f2a648fbc8cf1f22b8138ad9af8d265fea571f47ce32a2","observation_id":"96ee5786-bd27-4fbb-ace8-6dcb53a8203a","resolution":{"observed_at":"2026-08-07T12:59:44.237880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.105755Z","title":"Introducing o3 and o4 mini","venue":null,"work_id":"8c8a48e4-f1ce-4e96-aea5-9574f0b6d065","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.442780Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:49bef387ed31afa356f2fd1a3c6cebe4327c10bfe7ee76c60bd0aeaf9db33178","observation_id":"a2a320e6-784f-4152-90fa-d40238abbb74","resolution":{"observed_at":"2026-08-07T12:59:44.141647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:44.013782Z","title":"Grok-3 and the next generation of reasoning models","venue":null,"work_id":"4b8bc803-6a96-49b7-8bed-a521c5452e47","year":null},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.522769Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:8cfbdeaa148177125fc5c9c24cb87467da1508ac2aa023e14488856aed8fb8e3","observation_id":"7ca919f0-c98c-44a9-a08d-1c3439806fef","resolution":{"observed_at":"2026-08-07T12:59:44.048562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.709871Z","title":"TriviaQA: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.709871Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:08a72d14ce70eb576eed9d82a80199ba7732ddf68359ee4e6ef9f34ccb03fa26","observation_id":"d5c417bf-1447-4da1-90d3-fdc1f4bc9285","resolution":{"observed_at":"2026-08-07T12:59:39.709871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:59:39.781726Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.781726Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:6a64d06bc3064ab1130c8ccf540989bd930d32a6f73ce9db52f00f5756227d29","observation_id":"d4fb2b74-c697-4bfd-8579-261b7d2d5daa","resolution":{"observed_at":"2026-08-07T12:59:39.781726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.839500Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.839500Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:643ae73e332fc9569b7399117e8456cf15753b81d821219de39baa5bd58a95cf","observation_id":"644fd330-d804-43e6-a659-90515ff59a9f","resolution":{"observed_at":"2026-08-07T12:59:39.839500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.901407Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":"ffa5b98f-69a7-4483-985b-3ca0ff323875","year":2022},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.912855Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:d60759bb1f565546c58be1d816cb8c66211aa97729467f269a9f76f7963e16da","observation_id":"7e671f56-039f-4d6d-9ebf-f699aafa29e0","resolution":{"observed_at":"2026-08-07T12:59:43.954047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-07T12:59:40.012125Z","title":"Language models (mostly) know what they know.arXiv preprint arXiv:2207.05221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.012125Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:b97c9cea8bc45ee445e2718e908268f2767cf84b266e1d9fe79a19e97e87f788","observation_id":"d07b328d-4fc3-4dde-b7a7-3bc9cf23f8bf","resolution":{"observed_at":"2026-08-07T12:59:40.012125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:40.103165Z","title":"Detecting hallucinations in large language models using semantic entropy.Nature, 630(8017):625–630, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.103165Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:c0725c9079c60f36f9ed9c4a3917100cf99ca96b92cb09ea0bf2be4e1f8439b6","observation_id":"5d544f98-6e7d-473b-832b-d53a9d3d1f1b","resolution":{"observed_at":"2026-08-07T12:59:40.103165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:40.212539Z","title":"On calibration of modern neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.212539Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:03d19fcb520a0f68ab84ddb4bd5c7d4c2a4e54a0c7a9dce8b627d45ca3734978","observation_id":"98fdfb8b-4d9d-4f32-8da3-7de8b050e27b","resolution":{"observed_at":"2026-08-07T12:59:40.212539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.774564Z","title":"Benchmarking uncertainty disen- tanglement: Specialized uncertainties for specialized tasks.Advances in neural information processing systems, 37:50972–51038, 2024","venue":null,"work_id":"c7768030-2224-4a33-8b95-ec54d1dc8cb5","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.320314Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:837ea3305d667b828f57322bb3848ae15b63d261988428b619cb6c706b555631","observation_id":"dfd90084-708e-4ff0-a687-ead5ff14c5e0","resolution":{"observed_at":"2026-08-07T12:59:43.826331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:40.430239Z","title":"Measuring calibration in deep learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.430239Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:5fa3c6413615c27d74cec09d64f6d1d06f6741a4e84e9c04240aafeed6edad40","observation_id":"edc5dd6f-45f2-44c5-a9fc-b7813b164eed","resolution":{"observed_at":"2026-08-07T12:59:40.430239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:40.530832Z","title":"Predicting good probabilities with supervised learning","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.530832Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:27835340c031081cf7a7eba13d8fda22d8f09600841b4bc7d6dfac656344bce8","observation_id":"bf21376f-ff4a-48b1-92a2-72b3e96a872f","resolution":{"observed_at":"2026-08-07T12:59:40.530832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:59:40.568605Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.568605Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:29045485ecde69276ead7c23c00f7101259a3686103e244e24e5783dcb736d11","observation_id":"46cf49c1-3722-4012-8942-0e7e3b5abdae","resolution":{"observed_at":"2026-08-07T12:59:40.568605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:59:40.672286Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.672286Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:4c3be23e6f2d3550c843114666afcaab68eb2b3ab66b51e8c828222be4338ecf","observation_id":"dcc0c5ba-e9ed-4731-8080-4ea7282a70dd","resolution":{"observed_at":"2026-08-07T12:59:40.672286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:59:40.769319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.769319Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:7edc04a6e867b130fe2faf3a41689809f4618ccc848edb127ae16a92720e7244","observation_id":"28897efc-495f-44b7-bd9a-c3e2e5921e7d","resolution":{"observed_at":"2026-08-07T12:59:40.769319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.672638Z","title":"Identifying and mitigating vulnerabilities in llm-integrated applications","venue":null,"work_id":"c6622001-b34b-4bd0-97e7-3514f99725db","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:40.902069Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:b3111da492bf0ac388d91be25fd6de4d0cd7db50c9c8733bdee5fb72e7c29478","observation_id":"dfca067e-37b5-48a8-bf61-e03739bbbe41","resolution":{"observed_at":"2026-08-07T12:59:43.707808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T12:59:41.026953Z","title":"Gemma: Open models based on gemini research and technology.arXiv preprint arXiv:2403.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.026953Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:56d703271f3afb934a0b7ec686e5bfada975e79badc3a9e93fa85171750c4309","observation_id":"b7d3af9e-c9c5-436c-8b93-276255bf9c66","resolution":{"observed_at":"2026-08-07T12:59:41.026953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.594233Z","title":"Introducing gpt-4o: Openai’s new omni model","venue":null,"work_id":"6c58acff-b220-4ced-8486-328d59331dbb","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.103318Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:c13455adcb225f99ed8dd211e6dfe08d6e4311d17aad6ddfdd1ee50b31b52da7","observation_id":"7e56c294-799c-4035-b00d-968fef65f92d","resolution":{"observed_at":"2026-08-07T12:59:43.627738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.511854Z","title":"Gpt-4.1 overview","venue":null,"work_id":"410e4513-b886-4695-89d3-cc92c68daf0c","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.172123Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:9d7a033ac82e82ecd31467567b104cf255d7f306e3392b867508e9c9f6b2631a","observation_id":"205b571d-ccb9-4ea5-90d3-c80f83777942","resolution":{"observed_at":"2026-08-07T12:59:43.540243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.389576Z","title":"Introducing the claude 3 model family","venue":null,"work_id":"4852fd42-e648-4b18-98bb-39cfeddc0ec2","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.282128Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:caaf07295e02b1972ee2f50fecdec147bd9aa5c2d40073f06aa4ea56251f27bd","observation_id":"512247d6-a942-4999-81d9-86498a28fed7","resolution":{"observed_at":"2026-08-07T12:59:43.455340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:59:41.387827Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.387827Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:1684996a8239e25b5a00f93a4d017954ce5af23d47fcba98fb87c5e23329f5dd","observation_id":"0d888322-b373-4cb2-a7d7-eb0df487fed1","resolution":{"observed_at":"2026-08-07T12:59:41.387827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.295154Z","title":"Qwen3 technical report","venue":null,"work_id":"3a6f5fd9-509e-459f-a0bf-fe03caf86b30","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.466584Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:9d0aea0a24a7d93b3ac413e3bf60e83ffb0cb6d14c2b4f057831d432a73dcded","observation_id":"26d9cfaa-8dd7-44ff-9a27-a25118f1dbd6","resolution":{"observed_at":"2026-08-07T12:59:43.338288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.170578Z","title":"The kendall rank correlation coefficient.Encyclopedia of measurement and statistics, 2:508–510, 2007","venue":null,"work_id":"7a174202-72a6-4d34-982a-1c4ee438c4dc","year":2007},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.561704Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:824615ca6d6dc3458cbaa074e897f353f75664db968aac8c4f14822029068bd6","observation_id":"aa3f8ebf-8f15-438f-9205-c886c88f0e47","resolution":{"observed_at":"2026-08-07T12:59:43.219279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:43.071179Z","title":"i’m not sure, but","venue":null,"work_id":"0d6c30c5-8e40-4362-b6cf-9e2496f583b9","year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.651489Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:cbf265f506960ec63721f95f01b74cb2c39c226fe3838526015e3f1e79eeb47b","observation_id":"1b059fc6-3b14-4a6c-acab-2704abb5c733","resolution":{"observed_at":"2026-08-07T12:59:43.108420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19187","last_updated":"2024-05-20T01:53:36Z","snapshot_observed_at":"2026-08-18T09:28:29.473363Z","submitted_at":"2023-05-30T16:31:26Z","title":"Generating with Confidence: Uncertainty Quantification for Black-box Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19187","snapshot_observed_at":"2026-08-07T12:59:41.765614Z","title":"Generating with confidence: Uncertainty quantification for black-box large language models.arXiv preprint arXiv:2305.19187, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.765614Z"},"links":{"cited_paper":"/paper/2305.19187","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:6df29bfda17325881b0f3ddb1813cee8fce0962c36320885d7ca742ba945dce8","observation_id":"32c81645-cadb-4dfd-8b68-1c9f47e25d8e","resolution":{"observed_at":"2026-08-07T12:59:41.765614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:41.862601Z","title":"The internal state of an llm knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.862601Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:a2984676a882860bc3c8d715835282b731f8f9ddc4000de1e4273e56faa77f5e","observation_id":"dee90a92-4161-4657-a699-700ec5fb9550","resolution":{"observed_at":"2026-08-07T12:59:41.862601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:41.990181Z","title":"Inference- time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:41.990181Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:3460f5ad9cec8c87377cb9bbb80df4c4415ada0fcfb1b5a5c18eb5557a2351f6","observation_id":"10675e64-2b09-480d-83f2-e5211afa71ea","resolution":{"observed_at":"2026-08-07T12:59:41.990181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15993","last_updated":"2024-10-23T08:33:54Z","snapshot_observed_at":"2026-08-18T07:54:59.904276Z","submitted_at":"2024-04-24T17:10:35Z","title":"Uncertainty Estimation and Quantification for LLMs: A Simple Supervised Approach","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15993","snapshot_observed_at":"2026-08-07T12:59:42.079253Z","title":"Uncertainty estimation and quantification for llms: A simple supervised approach.arXiv preprint arXiv:2404.15993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:42.079253Z"},"links":{"cited_paper":"/paper/2404.15993","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:ee21a3a07620c7938964e275ce931b3d30a8d9f44679f2ae3303a1e97938d3ae","observation_id":"8f7b23fa-2184-4464-a311-2d9a6e5d2f00","resolution":{"observed_at":"2026-08-07T12:59:42.079253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08298","last_updated":"2024-03-25T06:01:49Z","snapshot_observed_at":"2026-08-17T20:41:58.531655Z","submitted_at":"2023-11-14T16:43:29Z","title":"A Survey of Confidence Estimation and Calibration in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08298","snapshot_observed_at":"2026-08-07T12:59:42.188284Z","title":"A survey of confidence estimation and calibration in large language models.arXiv preprint arXiv:2311.08298, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:42.188284Z"},"links":{"cited_paper":"/paper/2311.08298","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:b4460f6468986d65209c229590dfcda8dd42151b6ec0f7a4492f97a60d5a4222","observation_id":"8068ad81-a5df-45a1-9833-b1b3eef73a3d","resolution":{"observed_at":"2026-08-07T12:59:42.188284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15326","last_updated":"2024-10-20T07:55:44Z","snapshot_observed_at":"2026-08-16T19:54:34.730211Z","submitted_at":"2024-10-20T07:55:44Z","title":"A Survey of Uncertainty Estimation in LLMs: Theory Meets Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15326","snapshot_observed_at":"2026-08-07T12:59:42.294102Z","title":"A survey of uncertainty estimation in llms: Theory meets practice.arXiv preprint arXiv:2410.15326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:42.294102Z"},"links":{"cited_paper":"/paper/2410.15326","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:3094caae18d52f3c20377eb8c231d8ea3f389bdd8b163c8fbf10fc73cb3c4d42","observation_id":"914ff920-0b70-419f-ae25-9d0adb44237c","resolution":{"observed_at":"2026-08-07T12:59:42.294102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15850","last_updated":"2025-06-03T22:16:32Z","snapshot_observed_at":"2026-08-16T12:48:24.492574Z","submitted_at":"2025-03-20T05:04:29Z","title":"Uncertainty Quantification and Confidence Calibration in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15850","snapshot_observed_at":"2026-08-07T12:59:42.412963Z","title":"[Aa]nswer:?[\\s]*[\\n]*([A-J])","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:42.412963Z"},"links":{"cited_paper":"/paper/2503.15850","citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:6d951f104e940949433f8e6a9a03502a9e430190c258e1a4f14c2dcb76227c21","observation_id":"772fa1e4-ebcf-417f-9f15-0e801f62ac9d","resolution":{"observed_at":"2026-08-07T12:59:42.412963Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:39.612033Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:39.612033Z"},"links":{"citing_paper":"/paper/2505.23854"},"observation_digest":"sha256:8ba844a41edb6e789a1812003265289bf9f9232f9a25a78180572b8d8b006862","observation_id":"3747804d-053b-4181-997c-b61cd5e3e967","resolution":{"observed_at":"2026-08-07T12:59:39.612033Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23854","last_updated":"2025-05-29T02:04:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T10:59:56.107530Z","submitted_at":"2025-05-29T02:04:49Z","title":"Revisiting Uncertainty Estimation and Calibration of Large Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":33,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 11 inbound Pith citation observations for arXiv:2505.23854."}