{"as_of":"2026-08-21T15:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d3877d9145b64257b18b1c5ea4ae8ffb4f4a902939c11de115616cab472e83a","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:14:41.426953Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:40:58.274985Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T11:16:03.303665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13774","snapshot_observed_at":"2026-08-05T10:39:04.273817Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-17T17:37:38.616375Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:04.273817Z"},"links":{"cited_paper":"/paper/2505.13774","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:9315b64eee7ca5293a6824a56b99d7e16d45279df1f5de818479a6a0f7607f09","observation_id":"df660e94-2abd-4754-be99-949a2751cd90","resolution":{"observed_at":"2026-08-05T10:39:04.273817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.13774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13774","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"24ccd1ed-4693-473e-b41e-17599071664b","year":2025},"citing_paper":{"arxiv_id":"2604.10693","last_updated":"2026-04-20T08:48:59Z","snapshot_observed_at":"2026-08-17T00:15:15.477823Z","submitted_at":"2026-04-12T15:35:08Z","title":"FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T15:04:23.688239Z"},"links":{"cited_paper":"/paper/2505.13774","citing_paper":"/paper/2604.10693"},"observation_digest":"sha256:5f64e888bcf6d5329e9063e05c9e0ce1e6cb495f666d99f97b5e9823d9029a77","observation_id":"7729dbc3-4d62-424b-b6a5-fa630867821b","resolution":{"observed_at":"2026-05-11T11:16:03.312937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.13774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13774","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"24ccd1ed-4693-473e-b41e-17599071664b","year":2025},"citing_paper":{"arxiv_id":"2604.15726","last_updated":"2026-04-17T05:59:08Z","snapshot_observed_at":"2026-08-13T16:12:46.746296Z","submitted_at":"2026-04-17T05:59:08Z","title":"LLM Reasoning Is Latent, Not the Chain of Thought","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T08:49:05.178087Z"},"links":{"cited_paper":"/paper/2505.13774","citing_paper":"/paper/2604.15726"},"observation_digest":"sha256:3719c07ef107a61f93c00d80dd8d0e9d554f250f47cd3def44bbf3ba14d52a44","observation_id":"23ad4e73-b7ef-42c6-89ad-399ff2c6e743","resolution":{"observed_at":"2026-05-10T08:53:04.637091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13774","snapshot_observed_at":"2026-08-05T13:40:58.274985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03745","last_updated":"2026-08-04T14:38:06Z","snapshot_observed_at":"2026-08-20T16:24:43.343365Z","submitted_at":"2026-08-04T14:38:06Z","title":"Risky Business: Measuring The Faithfulness-Safety Tension","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:40:58.274985Z"},"links":{"cited_paper":"/paper/2505.13774","citing_paper":"/paper/2608.03745"},"observation_digest":"sha256:ed6f0fbc48fe0a58c84dbad55cdf1df9c0f6518bdec931344046ff30784f3f8e","observation_id":"a20b96d2-668e-4fd7-917e-c93fd6d2546b","resolution":{"observed_at":"2026-08-05T13:40:58.274985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13774/citation-record","integrity":"/paper/2505.13774/integrity","json":"/paper/2505.13774/citation-record.json","paper":"/paper/2505.13774"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04614","last_updated":"2024-03-14T03:48:08Z","snapshot_observed_at":"2026-08-19T06:09:11.502729Z","submitted_at":"2024-02-07T06:32:50Z","title":"Faithfulness vs. Plausibility: On the (Un)Reliability of Explanations from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04614","snapshot_observed_at":"2026-08-15T20:14:41.290531Z","title":"Faithfulness vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.290531Z"},"links":{"cited_paper":"/paper/2402.04614","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:71d87142d70c2599b6f0bb9d33c4a39d3890a255eee24009a2542fe1ab4646d9","observation_id":"180ed1c2-402c-4c37-a06f-214f6bc498ca","resolution":{"observed_at":"2026-08-15T20:14:41.290531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.295149Z","title":"Claude 3.7 sonnet system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.295149Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:47c6d6da1629941c9e0cbe2ecfac3111c19d85c7e44be3eb443c3f9fba9a1bce","observation_id":"09e8b36f-5b37-48aa-b2dc-3dc0f300879c","resolution":{"observed_at":"2026-08-15T20:14:41.295149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-16T12:51:00.810519Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-15T20:14:41.298997Z","title":"Chain-of-thought reasoning in the wild is not always faithful.arXiv preprint arXiv:2503.08679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.298997Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:bef4b3ac8f4f68ac90e07b712642b620b88015b4c127358e13efff7250e2a51e","observation_id":"34c1dd22-d3b5-4e4d-bc39-676eeb569201","resolution":{"observed_at":"2026-08-15T20:14:41.298997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18029","last_updated":"2023-06-30T15:41:47Z","snapshot_observed_at":"2026-08-21T15:29:49.940549Z","submitted_at":"2023-05-29T11:40:37Z","title":"Faithfulness Tests for Natural Language Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18029","snapshot_observed_at":"2026-08-15T20:14:41.303928Z","title":"Faithfulness tests for natural language explanations.arXiv preprint arXiv:2305.18029, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.303928Z"},"links":{"cited_paper":"/paper/2305.18029","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:83c6f49748185ca290e15ab1e1957b44f1ee18a9e23fe6b0e4116ab944dad3ab","observation_id":"77de9039-6502-41bf-a255-06d87bedf54d","resolution":{"observed_at":"2026-08-15T20:14:41.303928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-15T20:14:41.308198Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation.arXiv preprint arXiv:2503.11926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.308198Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:8934fa3ffb47e56f8aa32fc9085cd710862d76988dd0e9062861d2df86be9554","observation_id":"2d40209e-5118-41dd-a464-adbac0917f02","resolution":{"observed_at":"2026-08-15T20:14:41.308198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.903776Z","title":"Reasoning models don’t always say what they think","venue":null,"work_id":"5926bbf2-8512-40f9-af67-b0556f269ca7","year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.312222Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:dff3f4c660b2871a903b8e493ed42ffa77060e3b6563c33efb1fc96db8b3b6d2","observation_id":"b22d84a6-ed08-4bf0-bcdf-323d9f46874d","resolution":{"observed_at":"2026-08-15T20:14:41.908792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08678","last_updated":"2023-07-17T17:41:47Z","snapshot_observed_at":"2026-08-19T03:58:18.418295Z","submitted_at":"2023-07-17T17:41:47Z","title":"Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08678","snapshot_observed_at":"2026-08-15T20:14:41.316054Z","title":"Do models explain themselves? counterfactual simulatability of natural language explanations.arXiv preprint arXiv:2307.08678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.316054Z"},"links":{"cited_paper":"/paper/2307.08678","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:f2576d839c8c37c6e7c62d4951c9ae52adea78a950b9c3e82f4bb134a40fd5d2","observation_id":"d5c304b5-0ab3-438d-ad9b-0814d8cde3eb","resolution":{"observed_at":"2026-08-15T20:14:41.316054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-20T15:45:12.195576Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-15T20:14:41.319908Z","title":"Inference-time-compute: More faithful? a research note.arXiv preprint arXiv:2501.08156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.319908Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:220ccf29ce96664de569d0ce78005039cf808d11d79e83abce339785185b9c7b","observation_id":"be611117-1179-47ae-8c47-1f4361c5a698","resolution":{"observed_at":"2026-08-15T20:14:41.319908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-15T20:14:41.324673Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.324673Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:943799dd073988da54a506e994cd4cb2af126acab0f7844c8e72d5810c7ba355","observation_id":"d7524a57-ff57-4bbc-8d8c-45020960caec","resolution":{"observed_at":"2026-08-15T20:14:41.324673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04127","last_updated":"2025-01-10T14:31:21Z","snapshot_observed_at":"2026-08-18T22:14:47.638195Z","submitted_at":"2024-06-06T14:49:06Z","title":"Are We Done with MMLU?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04127","snapshot_observed_at":"2026-08-15T20:14:41.328082Z","title":"Are we done with mmlu?arXiv preprint arXiv:2406.04127, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.328082Z"},"links":{"cited_paper":"/paper/2406.04127","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:b62f0d47a39aa569b75f6af9d38f05ca3acd4ae6c23c27af8e0aae7232f0e897","observation_id":"ff84b833-00c3-4027-86ae-9077de8d2abc","resolution":{"observed_at":"2026-08-15T20:14:41.328082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:14:41.331856Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.331856Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:e828cd87760d0bfdd3d672a000244034d34e7130784d14837dea5fd5c887525e","observation_id":"676e1310-73f4-422b-810d-d2c0efafab99","resolution":{"observed_at":"2026-08-15T20:14:41.331856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19361","last_updated":"2025-03-30T14:48:59Z","snapshot_observed_at":"2026-08-19T16:46:19.417832Z","submitted_at":"2025-02-26T17:59:27Z","title":"Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19361","snapshot_observed_at":"2026-08-15T20:14:41.335305Z","title":"Can large language models detect errors in long chain-of-thought reasoning?arXiv preprint arXiv:2502.19361, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.335305Z"},"links":{"cited_paper":"/paper/2502.19361","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:9d1709774c1d711719a1959a5f33aa614cbf3626faee9302939970efc4dbaf6f","observation_id":"04280e3e-e42f-4dd6-96c5-464770b080b9","resolution":{"observed_at":"2026-08-15T20:14:41.335305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T20:14:41.339129Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.339129Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:af2b3c0240dd963841d784053c91b26a9b419fc3468b5a74c88a379b57e4a0e0","observation_id":"4d8e926b-da02-4ab7-b2ac-6a6f3058a5bb","resolution":{"observed_at":"2026-08-15T20:14:41.339129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.889600Z","title":null,"venue":null,"work_id":"e284548b-8cdb-401a-b2bf-e73c10aa05d2","year":2020},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.343027Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:e0db9130fcab5c058dcca31a16bbc131681dcbfa008612552acdac44952987a3","observation_id":"954a10ba-9621-4d09-996a-cc4a790ad7ab","resolution":{"observed_at":"2026-08-15T20:14:41.894444Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:14:41.346753Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.346753Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:3339cd9d67b6aff669ec085e69f8cea0658842a291cbc95441ec4becbcddadf2","observation_id":"ffa26ccd-20ab-45cc-b2ff-6a8cf947a190","resolution":{"observed_at":"2026-08-15T20:14:41.346753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-15T20:14:41.350010Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.350010Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:d0d98a35259f7b8ef9cba5d2c39f9cebfc5eae2f765fac4e2246197caece2f4d","observation_id":"fe3bdae5-dd59-4cf1-ab0d-2f5e22cdf334","resolution":{"observed_at":"2026-08-15T20:14:41.350010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-15T20:14:41.353851Z","title":"Measuring faithfulness in chain-of-thought reasoning.arXiv preprint arXiv:2307.13702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.353851Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:1d5e4aea36482b7109ab15ed279351a13a477a6d706227be560758d8416c896c","observation_id":"71115129-531f-45b2-aa7d-81532a1c224b","resolution":{"observed_at":"2026-08-15T20:14:41.353851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.358379Z","title":"Deepseek-r1 thoughtology: Let’s< think> about llm reasoning.arXiv preprint arXiv:2504.07128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.358379Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:168233aa922b6a6fdf01568adacd7530faea0e321802cd994cef4b0931ff4196","observation_id":"bc740fec-8a73-49e0-88cc-b5d23f55ed70","resolution":{"observed_at":"2026-08-15T20:14:41.358379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.877239Z","title":"Openai o3-mini system card, 2025","venue":null,"work_id":"db114eb8-a690-4443-9075-3ed3b7789156","year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.362216Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:5aac7f3141f07f58172cf8ef1fa4209e856f32c23be9a97a29e37822eebde797","observation_id":"f8be1fde-4913-4d0b-b731-03b5161b69d0","resolution":{"observed_at":"2026-08-15T20:14:41.881569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.365513Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.365513Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:8e10c5d7f94f0ef0a1b7ed8c22b68c70ee0028bdb0b79e5f9d6c561eb4da0ae2","observation_id":"23665c23-49a9-46d2-a464-8e8be3187dcd","resolution":{"observed_at":"2026-08-15T20:14:41.365513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.859219Z","title":"On the hardness of faithful chain-of-thought reasoning in large language models, 2024","venue":null,"work_id":"27d55064-7740-445c-891d-a58d9ea9e7e1","year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.368929Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:79cfb3012c958e4b7455b060bd884ed99e86758151be39f503dc87b4d19b674f","observation_id":"1837272f-d26e-473d-a771-f5df8ef09d57","resolution":{"observed_at":"2026-08-15T20:14:41.863620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.372113Z","title":"Qwen3, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.372113Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:30a3587229e1033fa6c1285dfbba079c8108c288b28117cee699a979f742aeac","observation_id":"6170b7d5-2f72-44ad-b10e-eb7df06f0933","resolution":{"observed_at":"2026-08-15T20:14:41.372113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.375670Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting.Advances in Neural Information Processing Systems, 36:74952–74965, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.375670Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:b3fb21aaad2d8e0411b6a55a1ed4634f6c197c20851cbd94f764953e48bad1da","observation_id":"559eca07-c3e8-4c0f-915f-34ebca8f758a","resolution":{"observed_at":"2026-08-15T20:14:41.375670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.379149Z","title":"Thoughts are all over the place: On the underthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.379149Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:ddcfa3c2e2c556361f70f93694fe071b3c48a0c672da1bf7789f111edaebea56","observation_id":"08edc20c-6720-4b79-8e12-a0e7bfd0a50c","resolution":{"observed_at":"2026-08-15T20:14:41.379149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.382460Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.382460Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:658240926a48fbc2b7f78b1d9a7a252955380bda31af075cde6740c6d123499b","observation_id":"ae1cc333-b203-444a-85ab-89c5e24c75a0","resolution":{"observed_at":"2026-08-15T20:14:41.382460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24370","last_updated":"2025-05-21T17:51:27Z","snapshot_observed_at":"2026-08-18T10:11:36.168812Z","submitted_at":"2025-03-31T17:50:13Z","title":"Effectively Controlling Reasoning Models through Thinking Intervention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24370","snapshot_observed_at":"2026-08-15T20:14:41.386011Z","title":"Effectively controlling reasoning models through thinking intervention.arXiv preprint arXiv:2503.24370, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.386011Z"},"links":{"cited_paper":"/paper/2503.24370","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:31314913756280ba95b9b524029ca16f4d855a14b419ea3b1c84cf8dc2521a2f","observation_id":"b6f3aa6b-0698-4cef-a95f-f9b04bfcf147","resolution":{"observed_at":"2026-08-15T20:14:41.386011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.390632Z","title":"Dynamic early exit in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.390632Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:c2d5714d3fda7585dad0333696392de8b64368a532380784240b4f907cff501b","observation_id":"421c5a21-ffa4-4c50-857d-3f51eeaaf7cd","resolution":{"observed_at":"2026-08-15T20:14:41.390632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15092","last_updated":"2024-09-02T22:40:20Z","snapshot_observed_at":"2026-08-16T13:49:58.172735Z","submitted_at":"2024-05-23T22:38:58Z","title":"Dissociation of Faithful and Unfaithful Reasoning in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15092","snapshot_observed_at":"2026-08-15T20:14:41.393940Z","title":"Wait”, “I need to verify","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.393940Z"},"links":{"cited_paper":"/paper/2405.15092","citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:970714d45f19bef9af2426f9dc5aee543940e97757ce7e105bd43dd8cd349e21","observation_id":"b2c17e41-24d1-407d-922d-536833e06d41","resolution":{"observed_at":"2026-08-15T20:14:41.393940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.819150Z","title":"‘json { “perturbed_option","venue":null,"work_id":"a82e1d4f-b3ef-47f2-83e3-8d4699ee9240","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.397893Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:c98dd3f8b7e795256054067c5b27a18ee235b086c5df4e8e8cc30ca96df4ad4f","observation_id":"28e89627-5a55-4984-a927-aef5d81f7385","resolution":{"observed_at":"2026-08-15T20:14:41.823096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.795339Z","title":"EXPLICITLY_CORRECTED","venue":null,"work_id":"12fc9671-2b9c-4341-8d02-cb2caef78ed7","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.404703Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:3c72cdd76e8c58616aa1dd4b44b412759088b3ac1345b4a2c36a4e4c102260e9","observation_id":"e6913a7e-b35e-469c-862f-1269869fcdc8","resolution":{"observed_at":"2026-08-15T20:14:41.799510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.782968Z","title":null,"venue":null,"work_id":"21486c4e-3e9d-4005-9244-b430bb1f757a","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.408895Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:f9e81a3bd871f80378ef23157f72b12d299372b3eba57160f46ba6ed7ed66eb3","observation_id":"b6004830-518f-4290-999d-c6890e2b9e1a","resolution":{"observed_at":"2026-08-15T20:14:41.786839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.768461Z","title":"EXPLICITLY_CORRECTED","venue":null,"work_id":"9daac8b4-8e08-4b58-bd32-5575abcf7935","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.412598Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:33e4b7e0fcfc81a6a99fd1a7bed20bc603aa944918f03b5c2cc6a4d259abbda3","observation_id":"c3a677ba-125c-4c57-9d50-d9484502c829","resolution":{"observed_at":"2026-08-15T20:14:41.773528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.755657Z","title":null,"venue":null,"work_id":"5f7f41fe-3215-4118-beda-275c29f36f2d","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.415849Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:250ca889643f9b0b593a8ea55eb0938c8ecf53c162328dac0f81b5c85a05742c","observation_id":"a4f29cec-b128-4afd-8e38-b865fa1fc2ea","resolution":{"observed_at":"2026-08-15T20:14:41.760714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.743205Z","title":"EXPLICITLY_CORRECTED","venue":null,"work_id":"9e8f1662-cbd1-436b-9101-9a585afb16ce","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.419374Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:d90fff57cb589dc7d888745a93f48b3df9d18f57ac58606887efb159008f0752","observation_id":"58b87729-4033-4c3a-a41a-ec2482933956","resolution":{"observed_at":"2026-08-15T20:14:41.747459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.807786Z","title":null,"venue":null,"work_id":"61ad8b45-5fa8-40c6-a955-dd3cd673df1b","year":null},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.423599Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:542f9cba12f80fa39194c3aac14022a9e857d5bf9895ae0f3b3c5905772415db","observation_id":"d0ca7ea5-c00f-46c3-a6a0-be65dcbd3da7","resolution":{"observed_at":"2026-08-15T20:14:41.811928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:14:41.730304Z","title":"EXPLICITLY_CORRECTED","venue":null,"work_id":"5e00c343-ef70-49de-80b3-d9913e66c664","year":2020},"citing_paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:14:41.426953Z"},"links":{"citing_paper":"/paper/2505.13774"},"observation_digest":"sha256:c739285a4e01efa5728f411f9238a78a906eb6bd56aceaea240dcbcc1f01bf32","observation_id":"8b170b2c-2e20-41ba-9b3f-fbf88a4689c0","resolution":{"observed_at":"2026-08-15T20:14:41.735428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13774","last_updated":"2025-05-28T19:41:14Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T04:10:37.037591Z","submitted_at":"2025-05-19T23:20:24Z","title":"Measuring the Faithfulness of Thinking Drafts in Large Reasoning Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 4 inbound Pith citation observations for arXiv:2505.13774."}