{"as_of":"2026-08-13T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f00d592ec64adbee46e8f3d87dbfb0d9e6be35454317df65e1bb78f244636ec","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:34:01.216310Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:12:11.740039Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T18:08:46.660526Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"cited_work":{"arxiv_id":"2502.01126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01126","snapshot_observed_at":"2026-07-03T18:08:46.660526Z","title":"Language models prefer what they know: Relative confidence estimation via confidence preferences.arXiv preprint arXiv:2502.01126","venue":null,"work_id":"25767c2e-aa93-4413-9ff8-5c56842f2c60","year":2025},"citing_paper":{"arxiv_id":"2408.09049","last_updated":"2026-04-19T19:02:30Z","snapshot_observed_at":"2026-08-08T20:15:07.345025Z","submitted_at":"2024-08-16T23:24:10Z","title":"Inertia in Moral and Value Judgments of Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-23T22:05:17.165589Z"},"links":{"cited_paper":"/paper/2502.01126","citing_paper":"/paper/2408.09049"},"observation_digest":"sha256:fc8d78f1b9df5730fc2f67688874bbe23068c84b5a67db7e1ed6f18fb93a99af","observation_id":"bb3ea3df-bf2f-4af3-b0de-ea09f7ab73b9","resolution":{"observed_at":"2026-05-23T22:05:50.180363Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01126","snapshot_observed_at":"2026-08-06T17:12:11.740039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11423","last_updated":"2025-07-16T13:02:26Z","snapshot_observed_at":"2026-08-10T18:24:59.174106Z","submitted_at":"2025-07-15T15:47:47Z","title":"Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:11.740039Z"},"links":{"cited_paper":"/paper/2502.01126","citing_paper":"/paper/2507.11423"},"observation_digest":"sha256:a5249e0c385d1fc60e6be03b611010a05d37d6541f5c7b9c8a5e2e5113400a8a","observation_id":"43d71121-9bf3-4a26-abc6-13a748106daf","resolution":{"observed_at":"2026-08-06T17:12:11.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01126","snapshot_observed_at":"2026-08-04T13:32:26.582182Z","title":"When answering a question, provide the answer and a confidence score between 0 and 1 for the answer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.05126","last_updated":"2026-06-18T21:02:47Z","snapshot_observed_at":"2026-08-12T12:09:32.959996Z","submitted_at":"2025-09-30T19:50:02Z","title":"Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models","version":3},"reference_index":701,"source":"pdf_text","source_observed_at":"2026-08-04T13:32:26.582182Z"},"links":{"cited_paper":"/paper/2502.01126","citing_paper":"/paper/2510.05126"},"observation_digest":"sha256:92f191657576695a3d817ff160bfa61bae615e7a50cf86e92de74e299e5b20ed","observation_id":"28674834-87fb-4268-b088-ed8ee9b67625","resolution":{"observed_at":"2026-08-04T13:32:26.582182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"cited_work":{"arxiv_id":"2502.01126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01126","snapshot_observed_at":"2026-07-03T18:08:46.660526Z","title":"Language models prefer what they know: Relative confidence estimation via confidence preferences.arXiv preprint arXiv:2502.01126","venue":null,"work_id":"25767c2e-aa93-4413-9ff8-5c56842f2c60","year":2025},"citing_paper":{"arxiv_id":"2604.11801","last_updated":"2026-04-13T17:58:43Z","snapshot_observed_at":"2026-08-11T04:54:07.804259Z","submitted_at":"2026-04-13T17:58:43Z","title":"CLSGen: A Dual-Head Fine-Tuning Framework for Joint Probabilistic Classification and Verbalized Explanation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:23.435736Z"},"links":{"cited_paper":"/paper/2502.01126","citing_paper":"/paper/2604.11801"},"observation_digest":"sha256:30419156a3d8344d8bf4144e79685b71443152959738b1334a08f47f03ebbeac","observation_id":"1fd14fac-9697-41a6-aa7a-98d5603db9b9","resolution":{"observed_at":"2026-05-11T09:36:01.641462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"cited_work":{"arxiv_id":"2502.01126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01126","snapshot_observed_at":"2026-07-03T18:08:46.660526Z","title":"Language models prefer what they know: Relative confidence estimation via confidence preferences.arXiv preprint arXiv:2502.01126","venue":null,"work_id":"25767c2e-aa93-4413-9ff8-5c56842f2c60","year":2025},"citing_paper":{"arxiv_id":"2606.17312","last_updated":"2026-06-15T21:39:47Z","snapshot_observed_at":"2026-08-09T16:35:02.364337Z","submitted_at":"2026-06-15T21:39:47Z","title":"Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T03:18:22.813002Z"},"links":{"cited_paper":"/paper/2502.01126","citing_paper":"/paper/2606.17312"},"observation_digest":"sha256:957897ae12da03c746e64b70f264c2c7b4b30791482d8e0d9ed3f4a938de6604","observation_id":"e72eaddd-d3d4-4942-a0af-23b64811a8ff","resolution":{"observed_at":"2026-07-03T18:08:46.662298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01126","snapshot_observed_at":"2026-07-31T21:55:17.528034Z","title":"arXiv preprint arXiv:2502.01126 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27967","last_updated":"2026-07-30T10:14:24Z","snapshot_observed_at":"2026-08-05T12:14:09.489312Z","submitted_at":"2026-07-30T10:14:24Z","title":"MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-07-31T21:55:17.528034Z"},"links":{"cited_paper":"/paper/2502.01126","citing_paper":"/paper/2607.27967"},"observation_digest":"sha256:93826fcee31c52d926d8240190d78689fb1c7f25cfb25951fe3e6cddc723ce0f","observation_id":"7bf6f57f-3570-48dd-bb75-b70e9ef523d9","resolution":{"observed_at":"2026-07-31T21:55:17.528034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01126/citation-record","integrity":"/paper/2502.01126/integrity","json":"/paper/2502.01126/citation-record.json","paper":"/paper/2502.01126"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.349790Z","title":"Claude 3.5 Sonnet","venue":null,"work_id":"d0c1aafd-ff1c-4e83-b578-4a997962f887","year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.040680Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:85835e5ed4fd56514df7128cb0e9012766328546103c604cf02659da4fec3933","observation_id":"038a8a8a-2c88-40a9-a9ea-9749e2ffe95e","resolution":{"observed_at":"2026-08-09T16:34:02.353051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.044614Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.044614Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:4ecc5efd20bc50abc22bf433cd3af86e71feae158c7a9479d1a4583fc748cea7","observation_id":"b62ee666-6b2d-4217-ae83-ad0abd695d9f","resolution":{"observed_at":"2026-08-09T16:34:01.044614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-09T16:34:01.048322Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.048322Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:a956d6c0bcca7c2ef6e9c23bbb92d82ee499812a4f98e9fbed9bd49dc9ce537a","observation_id":"e509e91f-eca9-494a-ab27-11b4242163d4","resolution":{"observed_at":"2026-08-09T16:34:01.048322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.052216Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.052216Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:e92159a0adcba6aa2191d7d538526c58eefc5c953c7b070df307aa13f4392fbb","observation_id":"8d4c0e2e-7db0-4283-abd4-d9c69e4036ff","resolution":{"observed_at":"2026-08-09T16:34:01.052216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-09T16:34:01.055766Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.055766Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:0eb0e2df9ac6d780bc222e4fe74543a310ff1a8c753e727ca873d67e352fd2aa","observation_id":"dd974ade-36e1-4551-b740-d9bc4a07e3e4","resolution":{"observed_at":"2026-08-09T16:34:01.055766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.333602Z","title":"DeGroot and Stephen E","venue":null,"work_id":"7c385073-6ebc-46ca-84e5-a779f8c2178d","year":1983},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.059492Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:c0434613a7d8e4acec22ddd122053ebba86f095c5f3c444711def583fcca7232","observation_id":"08ee4562-d1ac-4077-96c6-ba8fcb222618","resolution":{"observed_at":"2026-08-09T16:34:02.336942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T16:34:01.062909Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.062909Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:675b9c4b184781bae2b7966b587a25bf0b3a340bb82f219bb785484ad811f2f6","observation_id":"c20c354f-7fac-4b5d-bcd9-8fce50d63381","resolution":{"observed_at":"2026-08-09T16:34:01.062909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.323770Z","title":"Sivakumar","venue":null,"work_id":"676f14bc-af73-400d-815c-58807aa66adf","year":2001},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.066290Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:55b836d597de912180f34e7f2f18b24b0cc4e1cd9b432084e4c482390326d7e6","observation_id":"5bab9d77-0b27-4b7b-b112-dc3b5792b670","resolution":{"observed_at":"2026-08-09T16:34:02.327066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.313967Z","title":"On the foundations of noise-free selective classification","venue":null,"work_id":"d90dc9c9-27e4-496d-a0d9-3552b817a9c3","year":2010},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.069315Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:7d967493d9c55569e5d5031f9f4b57eabd982d1ef2fe422779d10e9e5b26c067","observation_id":"25bb767f-3e02-4c55-a6fd-94ae2ecbea01","resolution":{"observed_at":"2026-08-09T16:34:02.317442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.072264Z","title":"The Rating of Chessplayers, Past and Present","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.072264Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:8916a5b273f9f55289bb213d359b174a4df27ddfd9ebc2d33d84d87d66248e94","observation_id":"96c38c8d-dad7-473d-8026-6f82bf3b170c","resolution":{"observed_at":"2026-08-09T16:34:01.072264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-09T16:34:01.078869Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.078869Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:7ad915a6f1524c8b03ee5d1cdd335653083451542130dc00492f697b8867cc87","observation_id":"9ae8e036-984d-401d-bdb6-f64009ff1e13","resolution":{"observed_at":"2026-08-09T16:34:01.078869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05473","last_updated":"2021-12-11T01:07:39Z","snapshot_observed_at":"2026-08-07T19:36:51.151021Z","submitted_at":"2019-06-13T04:05:27Z","title":"Selective prediction-set models with coverage guarantees","version":2},"cited_work":{"arxiv_id":"1906.05473","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.05473","snapshot_observed_at":"2026-08-09T16:34:01.754439Z","title":"Selective prediction-set models with coverage guarantees","venue":"stat.ML","work_id":"1d7a8cf6-5abb-42b8-b4f4-d1a53d80988b","year":2019},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.082725Z"},"links":{"cited_paper":"/paper/1906.05473","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:749c12d1ec5fa4e7d7d1a6056e65a6ca1b4043046a9dadc8efbefbae062ef04e","observation_id":"9aa76400-b106-48be-b37c-9b7786440684","resolution":{"observed_at":"2026-08-09T16:34:01.759266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.303994Z","title":"Gptscore: Evaluate as you desire","venue":null,"work_id":"c6c7b4a4-c025-4fb4-b4b8-2b42f0e4a6e7","year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.086497Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:3abf1d9f88a8d515b5b7293ba6a15bd0b324e80027eae19ec3e83df7902b095e","observation_id":"84c0728d-b3a4-4b59-9740-b39a87669bfe","resolution":{"observed_at":"2026-08-09T16:34:02.307483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04599","last_updated":"2017-08-03T13:29:46Z","snapshot_observed_at":"2026-08-09T16:28:11.835630Z","submitted_at":"2017-06-14T17:33:50Z","title":"On Calibration of Modern Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.04599","snapshot_observed_at":"2026-08-09T16:34:01.089663Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.089663Z"},"links":{"cited_paper":"/paper/1706.04599","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:3f025c51a66bd7f11604d720468f72364da1e6b007de70c88278bb8ae721f218","observation_id":"3feebc79-0d96-458c-95dd-9bf0520e9029","resolution":{"observed_at":"2026-08-09T16:34:01.089663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.294438Z","title":"Weinberger","venue":null,"work_id":"b18c379e-bf13-4975-87f1-6b7ac969a0b1","year":2017},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.093138Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:e7199330bffea450b5cbf34c9aa1bfb7498328d5036865cba782a25b962c0415","observation_id":"eec04e32-23a9-4e57-bff1-806039ae5465","resolution":{"observed_at":"2026-08-09T16:34:02.297820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.096221Z","title":"A baseline for detecting misclassified and out-of-distribution examples in neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.096221Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:ad7135585f45d8a4e9d8c3ab69a6c6dec9a8257df20df1229d9522b9e9edc399","observation_id":"1b1f8248-2013-4fe3-b151-4b20f7fdf2c7","resolution":{"observed_at":"2026-08-09T16:34:01.096221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.278882Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"7dc0717b-84de-4f81-b034-531c6599fb3b","year":2021},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.099247Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:0c0b00fbbdb91679eaddd47a95d86f76ee7bc891dce6ccbf8721086ff4e10936","observation_id":"24e92e21-8248-4067-b93c-ffb1897ae9a2","resolution":{"observed_at":"2026-08-09T16:34:02.282327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-09T16:34:01.102298Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.102298Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:b0679adba39c2bc8852f86937da35c911ab6d13738b504c3ef6fdd3e07edb6bb","observation_id":"8f8a93b4-2247-4cdd-9bfd-ceab9fcf0f74","resolution":{"observed_at":"2026-08-09T16:34:01.102298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.269223Z","title":"Minka, and Thore Graepel","venue":null,"work_id":"e8fa6c67-36a2-4258-8bb9-0013c2917a3a","year":2006},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.105681Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:99e266bbf8d8508e5ceb73bdc93518b15d75dae07b05e5c56dd63acf812a614e","observation_id":"7598ce1d-e0dd-466c-8826-c37ce81c98b7","resolution":{"observed_at":"2026-08-09T16:34:02.272584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-13T01:26:47.642290Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-09T16:34:01.108285Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.108285Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:8cb687cf59f3434355597a5371e1552e567c2ae4c8bf598b471e028c75f6042f","observation_id":"ff0b0cc7-f982-4dc0-999b-8b60016070d5","resolution":{"observed_at":"2026-08-09T16:34:01.108285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.259052Z","title":"Selective classification can magnify disparities across groups","venue":null,"work_id":"65d41784-a5e1-4a32-9ea7-a18311a930cf","year":2021},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.111175Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:a3cc667190b78c401b36c0a0aca39242227658cdef136c07eb291f449c42f2ac","observation_id":"8b5e1787-7bf2-43de-94cf-8f1335f3d6f1","resolution":{"observed_at":"2026-08-09T16:34:02.262978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.114327Z","title":"Language models (mostly) know what they know, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.114327Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:be3459e9e7c9a2af6ae44e9ee39645222e608131d6c5bc7fc2cd7401ef953749","observation_id":"6c3ee263-67cd-451d-8919-8526caca3851","resolution":{"observed_at":"2026-08-09T16:34:01.114327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.117257Z","title":"Kemeny and J","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.117257Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:14ea7b2f755fb3dbf1261f4ed58bd79f2e4cb9d19da16dfe781855732abfbf14","observation_id":"214b97c4-088e-4703-9659-0bf53bcb0b76","resolution":{"observed_at":"2026-08-09T16:34:01.117257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.243382Z","title":"Unanimous prediction for 100\\ In Association for Computational Linguistics (ACL), 2016","venue":null,"work_id":"8d5a5883-715d-4ee1-8008-ddd8ec2ffb44","year":2016},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.119947Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:67c74de8515993be0a956c7b176e62e3a348b6c0e7e4ab8b147efce7c6d660f0","observation_id":"835eca9d-2993-4d03-97c4-b2cf7246dd56","resolution":{"observed_at":"2026-08-09T16:34:02.247076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-09T16:34:01.122641Z","title":"Narayanan, Yuhuai Wu, Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan, Ce Zhang, Christian Cosgrove, Christopher D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.122641Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:d9ccef81cb1ec496b32b4a9fdb8baa17ac28b2813890753d60a394d64a4de20a","observation_id":"06999197-03dc-4598-b2eb-405ce3fdcf68","resolution":{"observed_at":"2026-08-09T16:34:01.122641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-09T16:34:01.125363Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.125363Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:e8cf05b58c3e58ec387ac7aa56a01d1fd1b028ffa517d39b1de3c2cf48d37f84","observation_id":"8d5cf93c-90ee-401f-8f68-ed55cd51c49c","resolution":{"observed_at":"2026-08-09T16:34:01.125363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.128934Z","title":"Teaching models to express their uncertainty in words","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.128934Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:75d44eb22c0caf66be33f3a5a8c4001f6e1f353593ae93bfa26665be92a1df9b","observation_id":"03507724-f635-4e18-9ef5-b3ed1d0d7dcf","resolution":{"observed_at":"2026-08-09T16:34:01.128934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-08-12T13:30:30.615172Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-09T16:34:01.131879Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.131879Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:fd92cd8dd13e640698ec1634392588ded0ed0fba30f6e658a91c4efc09940f02","observation_id":"c6e9c625-e1fd-46bd-b41a-cfe9d4556419","resolution":{"observed_at":"2026-08-09T16:34:01.131879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.226820Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"35e42374-9b33-4d16-afb1-55fb4ab69765","year":2018},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.135067Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:8775d2e28aeee5aba4909a99d68716c22ad5b5d516ed2160075cf76b927bfe50","observation_id":"fc686808-1158-4955-a2a4-f7374a987631","resolution":{"observed_at":"2026-08-09T16:34:02.230402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.216909Z","title":"Murphy and Robert L","venue":null,"work_id":"a818e918-ac5d-4806-a04c-1ed2e15cf499","year":1977},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.138224Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:20c557e2a7e29fcb9fb738817b804709a0215fbdc0a0df1214487034b4a5a4bc","observation_id":"61d12a34-b748-494d-b47d-10e35f762cbe","resolution":{"observed_at":"2026-08-09T16:34:02.220422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.206700Z","title":"Cooper, and Milos Hauskrecht","venue":null,"work_id":"2bfaed27-e634-44b1-baf7-33073b5b9c4a","year":2014},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.141299Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:8083fe1d80fdd5e26274ed41a4e6916f4451f597f7e0526a5e8398cbb62f58c5","observation_id":"4bf1fa61-233e-4c5e-9403-b6c7626adde1","resolution":{"observed_at":"2026-08-09T16:34:02.210087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.197236Z","title":"Cooper, and Milos Hauskrecht","venue":null,"work_id":"ad4fc2a2-f5c6-46e2-8ca7-aca01a244891","year":2015},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.144307Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:54111f1c110ddb732ef5878cc570489b43a2e3c9b906e2615cde3b346726411b","observation_id":"809fcde4-914b-4aae-a4e7-5740952b6dc1","resolution":{"observed_at":"2026-08-09T16:34:02.200526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.187499Z","title":"Negahban, Sewoong Oh, and Devavrat Shah","venue":null,"work_id":"388bd72c-757d-44f9-a8f8-6c0885b47283","year":2012},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.147483Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:8ed3442aa1e5dfdf7f72001ed17b8314c0c246b2defc8325d798d8cbad5999d9","observation_id":"fb0ad1e6-d1d5-4f90-a3a8-d037c20bf836","resolution":{"observed_at":"2026-08-09T16:34:02.190942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.177391Z","title":"Introducing chatgpt","venue":null,"work_id":"9f887ac3-fdc0-4308-81f6-c89854e4c9fd","year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.150539Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:f6b2badb2a953b8e6543764ebfd00c0c4659dc18c7a28a841ebb878b13d302e9","observation_id":"c8371c9a-25c4-4a57-9b5f-6d07069b7ca9","resolution":{"observed_at":"2026-08-09T16:34:02.180830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.167317Z","title":null,"venue":null,"work_id":"f6b9ae85-2983-4c69-bbfc-80aa849da5dc","year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.153861Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:91aedd1ac738cc935fd7fd9647d9c0e82d7827902f2acaaf5ecd441a04044686","observation_id":"1eba87ca-a0ff-4536-913c-2e85d49ef04f","resolution":{"observed_at":"2026-08-09T16:34:02.170988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.156716Z","title":null,"venue":null,"work_id":"45d86f63-231f-40c3-a423-6ed68ded00dc","year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.156787Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:c484ce7b26f6d638dae578d9bc76f8abd3593073cd1883fc73d8df2ad1eebc3f","observation_id":"b6fe4d77-bb6e-438c-9d33-5bfba0793266","resolution":{"observed_at":"2026-08-09T16:34:02.160560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-09T16:34:01.159841Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.159841Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:1980132781d6d618a340419ffd73c0a4b3f634571936000b8ce072c2bdf1b351","observation_id":"c2980b56-f760-43b1-8d41-0216320d50f9","resolution":{"observed_at":"2026-08-09T16:34:01.159841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.146586Z","title":"The pagerank citation ranking : Bringing order to the web","venue":null,"work_id":"1a83a849-7b99-42d0-8dd0-ec865c23f508","year":1999},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.163222Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:1faf0197800f8a6541fbf0cac7a0fdd087499e2dfa7d43af3220ce101794ade0","observation_id":"14675387-9817-4f41-8561-634655389597","resolution":{"observed_at":"2026-08-09T16:34:02.150163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-09T16:34:01.166117Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.166117Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:e8fb8db7801d95bc6a0fcc2182fbb552767999a62dfbac5c7305ea8351d5b719","observation_id":"ccdef85f-4f49-4f33-99bc-d43929110c23","resolution":{"observed_at":"2026-08-09T16:34:01.166117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-09T16:34:01.169386Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.169386Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:84d7a11b042fc16aa9d780d7b3d83a58d218c0db21e4991e282193f458b33604","observation_id":"6cc7a1ab-0bfa-456e-84d3-9794834aace5","resolution":{"observed_at":"2026-08-09T16:34:01.169386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-09T16:34:01.172731Z","title":"Socialiqa: Commonsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.172731Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:d623a437e2094eaad2082c87f37e1bd84b948647a62cd08a352877e365ec9c8b","observation_id":"61db9865-fe90-4a1d-92a6-3fc53e1f211a","resolution":{"observed_at":"2026-08-09T16:34:01.172731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08877","last_updated":"2023-11-15T11:27:44Z","snapshot_observed_at":"2026-08-13T05:24:53.829651Z","submitted_at":"2023-11-15T11:27:44Z","title":"Llamas Know What GPTs Don't Show: Surrogate Models for Confidence Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08877","snapshot_observed_at":"2026-08-09T16:34:01.176258Z","title":"Llamas know what gpts don't show: Surrogate models for confidence estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.176258Z"},"links":{"cited_paper":"/paper/2311.08877","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:042f2e007932b04088e7f611bc92f9db1a554bca1ce370e3205537fa6a4cb72a","observation_id":"1b190f9c-eaa6-47a0-9b53-f2eb4ebbd08e","resolution":{"observed_at":"2026-08-09T16:34:01.176258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.136348Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":"0acd740f-4a31-4e8e-8357-2df0ce514b3b","year":2019},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.179834Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:33f4cb5df834343f0ae85e249d26640da06fd1725552073663813b0abb6f0344","observation_id":"5f533e8a-e0eb-49b3-b257-28eb7152f05d","resolution":{"observed_at":"2026-08-09T16:34:02.140002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-09T16:34:01.182852Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.182852Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:aa09adeb8446e0d7a4570bc43d3f34c21eb08cfe4500dee1c6cc230c5e9660ef","observation_id":"2124298d-b595-4338-a9f5-e0e5259c4e55","resolution":{"observed_at":"2026-08-09T16:34:01.182852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08401","last_updated":"2023-11-14T18:59:15Z","snapshot_observed_at":"2026-08-13T05:25:21.623128Z","submitted_at":"2023-11-14T18:59:15Z","title":"Fine-tuning Language Models for Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08401","snapshot_observed_at":"2026-08-09T16:34:01.186499Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.186499Z"},"links":{"cited_paper":"/paper/2311.08401","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:22b06a8a61634326f0e904ce1814fe4729968b5e351c2341c11fa6644d496574","observation_id":"65bf4de6-e9e0-4442-8bd8-c5423652d08f","resolution":{"observed_at":"2026-08-09T16:34:01.186499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.125993Z","title":"Nicolaus Tideman","venue":null,"work_id":"586849ab-e328-4a03-a968-e73a80adbc26","year":1987},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.189808Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:389904d85a45c65ab2a7667a8572b537b57e87061c134f4aa61b1622d4040f9e","observation_id":"c6f56a58-80d5-4552-824c-d62dbe82c527","resolution":{"observed_at":"2026-08-09T16:34:02.129491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.16181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.485942Z","title":"Minimum weighted feedback arc sets for ranking from pairwise comparisons","venue":null,"work_id":"fcf95467-aa1d-496a-a3e3-e97bab6e3689","year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.192801Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:9e40489c7c8678b7ba29592b88812f4442d9dbbc1107d0c8e0c9438f7acaf94f","observation_id":"395bdfd9-87ea-469d-be88-b663e9bbf964","resolution":{"observed_at":"2026-08-09T16:34:01.493854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-09T16:34:01.195288Z","title":"Chi, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.195288Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:aae58fe0ba77365ccd1945addb0e667239f708063525b429b13ddda90d40ec7b","observation_id":"675fb41e-9d80-45c8-8a65-7ea8e7942630","resolution":{"observed_at":"2026-08-09T16:34:01.195288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-09T16:34:01.198146Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.198146Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:b1325ea91bef13469cf7bf36407b831c1fa365abf9163caaa4290eb110a6ecf9","observation_id":"fa845f90-2b3f-44b0-979b-8234e270609e","resolution":{"observed_at":"2026-08-09T16:34:01.198146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-09T16:34:01.200844Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.200844Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:c99ca75735c748ec14eeab2ca8709a121523d021b777f3fdec72d9735a67436d","observation_id":"9b626cbf-2f47-49aa-982f-bf923d01ef5c","resolution":{"observed_at":"2026-08-09T16:34:01.200844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-09T16:34:01.203730Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.203730Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:12dba48736782cac8aaa149232f050942c40092e50c4bfae73e2a29ddc169526","observation_id":"56b68cfa-eb5d-43fe-8c34-ae891a55b512","resolution":{"observed_at":"2026-08-09T16:34:01.203730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-09T16:34:01.206481Z","title":"Xing, Haotong Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.206481Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:b7b26edb9b0024ad289266ee57ff88575886617b3a83c29c6f0644b32ea6ac15","observation_id":"b2ac2982-bf43-48a5-bc46-a9656d66f181","resolution":{"observed_at":"2026-08-09T16:34:01.206481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:02.115077Z","title":"Navigating the grey area: Expressions of overconfidence and uncertainty in language models, 2023","venue":null,"work_id":"30c26b76-0b4e-42fb-ab29-2594d6856f31","year":2023},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.209775Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:0ef4d2110c09a545736bf1596eca220ae17360c61b696eb8e05b4d32ccf36c68","observation_id":"70090b81-bcbc-4764-890a-f84d4aae0c8f","resolution":{"observed_at":"2026-08-09T16:34:02.119168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-09T16:34:01.212836Z","title":"Ziegler, Nisan Stiennon, Jeff Wu, Tom B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.212836Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:296a4c3938a2db48f54e014f081995f5ff27de1cc103f3e7bca585e71837b6f5","observation_id":"425ab6e1-d2b3-437c-a0e1-2b9c2380ce30","resolution":{"observed_at":"2026-08-09T16:34:01.212836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T16:34:01.216310Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T16:34:01.216310Z"},"links":{"citing_paper":"/paper/2502.01126"},"observation_digest":"sha256:c4c007ae0dbf1be1776c152dc0a44b822207b6dc31a8f982bf5e35824627e968","observation_id":"360b2d10-5592-47bc-8985-5d0c1396371b","resolution":{"observed_at":"2026-08-09T16:34:01.216310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01126","last_updated":"2025-02-03T07:43:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T12:06:46.850922Z","submitted_at":"2025-02-03T07:43:27Z","title":"Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 6 inbound Pith citation observations for arXiv:2502.01126."}