{"as_of":"2026-08-22T23:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60fda224afe588cee64ac6d44a441ee92f6534632453a21aa49e18015573d8ef","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:22:55.728237Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02089/citation-record","integrity":"/paper/2608.02089/integrity","json":"/paper/2608.02089/citation-record.json","paper":"/paper/2608.02089"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-17T02:01:42.843839Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-04T15:22:54.216027Z","title":"Chain of thought monitorability: A new and fragile opportunity for AI safety, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.216027Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a8d67b262defc1d99d38686036b329ea6affe49cb7e98ee41f5205f11891e649","observation_id":"a373dd73-b609-4f09-97fd-80d1fbab6cd3","resolution":{"observed_at":"2026-08-04T15:22:54.216027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-04T15:22:54.308068Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation.arXiv preprint arXiv:2503.11926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.308068Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:b4b5d86c5759c1ccb60bf258abccf8af8d3513f0d72f7d14d7e9e71bf7d923c5","observation_id":"e8199497-cb67-4eed-a4ba-2fb9fa508bdd","resolution":{"observed_at":"2026-08-04T15:22:54.308068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.415009Z","title":"Monitoring monitorability","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.415009Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:dbfd32cddbab9b71eb4ba898e613156d005abc66fcccdce1a3d4cc88d378ca3a","observation_id":"ba035bc8-4993-4dff-ac0f-280eacbe58e1","resolution":{"observed_at":"2026-08-04T15:22:54.415009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.498886Z","title":"Learning to reason with LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.498886Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:7ecb8fb38ca933656ce4425249a3ba3704c3e8a47d85fb73dfba1bd20fca2f4f","observation_id":"f4d9de79-eb3e-4151-8588-b0e7e667031c","resolution":{"observed_at":"2026-08-04T15:22:54.498886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.583556Z","title":"Reasoning models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.583556Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:aad50ccf4691ab1ef424f1c73649f89dacac73d8545afccc3e71cee093dd2117","observation_id":"00dd6d45-59b4-434d-bdba-bdad35b6d4d9","resolution":{"observed_at":"2026-08-04T15:22:54.583556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.689330Z","title":"Gemini thinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.689330Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:f1abdb9529c16aed8cde730824622e4c6b001fc385f173daa9896234151ca3c3","observation_id":"8fc9aca7-83dd-4247-8d85-cc1216172457","resolution":{"observed_at":"2026-08-04T15:22:54.689330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.764693Z","title":"Extended thinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.764693Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8070e0fed3b61ac96618492c931e18ba1e5a4cd54bb1b7bcc9dcb7d67472d22c","observation_id":"f2f15e35-9ecf-4171-b629-6090ef04fc9e","resolution":{"observed_at":"2026-08-04T15:22:54.764693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.853124Z","title":"Detecting misbehavior in frontier reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.853124Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:9ea90d416b038fe3383ae83084e386ff335a98045bcc8397d39c78c899418255","observation_id":"8ee19f08-34c6-4dcc-902d-64bca9bf7e06","resolution":{"observed_at":"2026-08-04T15:22:54.853124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.926117Z","title":"Evaluating chain-of-thought monitorability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.926117Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:7baf29338b01726e1523fec1bcaed0a3854c7ba0b96184689810b209e640474c","observation_id":"8a84790b-1427-421b-8fef-1e05d624f26f","resolution":{"observed_at":"2026-08-04T15:22:54.926117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.004805Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.004805Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:db54ce55b8c0548eeea23d30bfc7aa77d97ae6fcacf112e123fc4c08163906ea","observation_id":"1d31e4bc-575d-4e23-ae8b-65a98f9702fe","resolution":{"observed_at":"2026-08-04T15:22:55.004805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-04T15:22:55.096165Z","title":"Language models (mostly) know what they know.arXiv preprint arXiv:2207.05221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.096165Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:611aa13a8537b3f0b18d7220c3fd9c926d733e66692f91cd5de8766050f8c33a","observation_id":"e3830b88-790d-46b6-a444-51592cf03256","resolution":{"observed_at":"2026-08-04T15:22:55.096165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.139696Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.139696Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e577e80ab7f5e004a78398bc08c1b89740005680132de6e6a58dd86bec8a034a","observation_id":"670ec74b-dca9-47c8-a921-a4b1b4dc5314","resolution":{"observed_at":"2026-08-04T15:22:55.139696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.232820Z","title":"The internal state of an LLM knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.232820Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:184eab02450183416e2c822469ff807315219e8a3694802c4bcca99d082d4bc9","observation_id":"9a60e5fd-6ff8-4cf1-82f8-481d7bc715e7","resolution":{"observed_at":"2026-08-04T15:22:55.232820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.266444Z","title":"Qwen3 model collection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.266444Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:7c2f020307951542454ba8bdffd85e590553bc1ca99aee7b80d1ad3fe664a22c","observation_id":"f8de3072-45d2-49d5-bdb2-b18bc8598df4","resolution":{"observed_at":"2026-08-04T15:22:55.266444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T15:22:55.340640Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.340640Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:3764ec922a614e58aa01c5d1b09e56eb4fa101f5803224078212e97069fae162","observation_id":"fbf82d27-7fd1-43e1-a317-6855fc7398c7","resolution":{"observed_at":"2026-08-04T15:22:55.340640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.479309Z","title":"Introducing gpt-oss","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.479309Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:91c58c0966fea8a221bbd702006cb11c51841eddf9ed1b05da5741c9e6ed4057","observation_id":"63c905e8-16e3-4985-928c-ab192a798ba0","resolution":{"observed_at":"2026-08-04T15:22:55.479309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-04T15:22:55.601332Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.601332Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e4ce80810018305741c6ba8f912ce8d9c388dd10867f4ec59698eeb0a9d2356e","observation_id":"fca9c4e1-5f2f-4d9f-b351-103c57a10434","resolution":{"observed_at":"2026-08-04T15:22:55.601332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.611081Z","title":"GPQA: A graduate-level Google-proof Q&A benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.611081Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:68daba0c6e25f92e9aa15ef83783e4fc3fb116e7283098e52b1f11b3f37bcf86","observation_id":"39e291d4-6ebd-4712-9ce7-047c3036de32","resolution":{"observed_at":"2026-08-04T15:22:55.611081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.613881Z","title":"MMLU-Pro: A more robust and challenging multi-task language understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.613881Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:373ed4d117a572c4dff1172f049442650f35f6362b67c253b86f89bd13b277ff","observation_id":"69d9e42c-34f4-49ef-a96f-d119cd9e6672","resolution":{"observed_at":"2026-08-04T15:22:55.613881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.616785Z","title":"Benchmarks saturate when the model gets smarter than the judge.arXiv preprint arXiv:2601.19532, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.616785Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:3cdc9079f582574cb5120a4ce7557aa0d4d29559ef01cfb32ca832585c86e649","observation_id":"d26bead1-62ce-4b4b-9afc-07b0f2c4c903","resolution":{"observed_at":"2026-08-04T15:22:55.616785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.619712Z","title":"Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.619712Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8f3feac0a31b427b66759e16dab6d834996bf08d199818e416aed257463ee804","observation_id":"69bd3f39-8981-4b20-963f-77b5d753461c","resolution":{"observed_at":"2026-08-04T15:22:55.619712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.622234Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.622234Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8d78db46cb8a5baba291db9321158264219ff25de268e1292d914b762e1df5ab","observation_id":"9285d41e-9d1e-4e76-9931-60e05bacd976","resolution":{"observed_at":"2026-08-04T15:22:55.622234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T15:22:55.625115Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.625115Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:f68a75b798aff8a00cfa4b101043e68989efd06d8c143ad80ffefef3ddf2560a","observation_id":"dd54062b-bbea-4263-b1a7-d638b3788517","resolution":{"observed_at":"2026-08-04T15:22:55.625115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.627908Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.627908Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:21c675b9fc383be420f098a167395b218b9115205161851e2f122041abe530f3","observation_id":"4590fb20-cd6a-4419-9b69-45f05f9bd1b8","resolution":{"observed_at":"2026-08-04T15:22:55.627908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.630303Z","title":"The relationship between reasoning and performance in large language models–o3 (mini) thinks harder, not longer.Scientific Reports, 16, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.630303Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:194dad62214ad7512a097fae88c2e6c44f3ee0ee907112d532c2824a3d4750c9","observation_id":"9b3ff758-276c-4af8-addb-b5a0e8efe634","resolution":{"observed_at":"2026-08-04T15:22:55.630303Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-04T15:22:55.632776Z","title":"Measuring faithfulness in chain-of-thought reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.632776Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:02a36a7b9192860e159652857c2ee3c5d6949b73f37dc0093bea3024189d9ef4","observation_id":"bbe8b4e2-2a48-4e3a-b026-7ade65457f15","resolution":{"observed_at":"2026-08-04T15:22:55.632776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.635411Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.635411Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:b38a75686f50efef12c972b07e40739ea880cc89c97a7b0512c1388cd0ac85be","observation_id":"20c34a3c-1df0-497c-82f2-e95c5ac0b4f9","resolution":{"observed_at":"2026-08-04T15:22:55.635411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.638176Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.638176Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:bf4f0a58fe795915d8e471e0f5533ddbe6f7a817bf9d73803e2f30bb8b6d066e","observation_id":"f5d986b2-c8e4-4cf2-8906-e615e3486f3c","resolution":{"observed_at":"2026-08-04T15:22:55.638176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-04T15:22:55.643430Z","title":"Reasoning models don’t always say what they think.arXiv preprint arXiv:2505.05410, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.643430Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:5d73c681924de2319eaf000ca3a6146bb1419fb9fb4e84370e0dbc9dbd8e4cc0","observation_id":"891febc3-c56d-4222-8264-e34320446d0f","resolution":{"observed_at":"2026-08-04T15:22:55.643430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.646293Z","title":"MonitorBench: A comprehensive benchmark for chain-of-thought monitorability in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.646293Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a29e859195653c827a24d6ffd69dd8b7ce4c26db3a013094fef578fad3cbd9e6","observation_id":"3bd74589-00ab-48b7-abdc-77fd4de9211d","resolution":{"observed_at":"2026-08-04T15:22:55.646293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.648866Z","title":"Recent frontier models are reward hacking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.648866Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:3a9e982e93128720dcc808a96da76fdff09666edaaf3540d724de7b474a5f0ba","observation_id":"20b9d831-1796-4841-996c-999c335b3812","resolution":{"observed_at":"2026-08-04T15:22:55.648866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.651357Z","title":"Zimmermann, David K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.651357Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:61cb452a9777db1734193118f5f4f8a685109c5ad6895791270450b30a34e791","observation_id":"8c240b39-bb8d-4940-955f-43cd49f44316","resolution":{"observed_at":"2026-08-04T15:22:55.651357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29192","last_updated":"2026-05-28T00:08:35Z","snapshot_observed_at":"2026-08-17T01:17:36.056598Z","submitted_at":"2026-05-28T00:08:35Z","title":"ReasonOps: Operator Segmentation for LLM Reasoning Traces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29192","snapshot_observed_at":"2026-08-04T15:22:55.653868Z","title":"ReasonOps: Operator segmentation for LLM reasoning traces, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.653868Z"},"links":{"cited_paper":"/paper/2605.29192","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:19b557318831160c2b522e08a4756a14a9e961aa327323e1c5bed8edd8fe83d3","observation_id":"0faacaec-9e86-4592-84f2-9481b9a78dd7","resolution":{"observed_at":"2026-08-04T15:22:55.653868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-15T02:10:25.292080Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.09786","snapshot_observed_at":"2026-08-04T15:22:55.656489Z","title":"Length penalties make chain-of-thought less monitorable, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.656489Z"},"links":{"cited_paper":"/paper/2607.09786","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:6b317b4690c96be432d2a427ee5cce32237b26d7181b17cea34548964b91d9c7","observation_id":"6c431f89-a143-491d-b303-ff92ff1eb2f6","resolution":{"observed_at":"2026-08-04T15:22:55.656489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07267","last_updated":"2026-05-12T18:36:11Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T15:50:44Z","title":"How to Steal Reasoning Without Reasoning Traces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07267","snapshot_observed_at":"2026-08-04T15:22:55.659623Z","title":"Morris, and Vitaly Shmatikov","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.659623Z"},"links":{"cited_paper":"/paper/2603.07267","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:eef5f0218cfb76aea6acad757213e04887393c9e942b7568ff415d4093c2234e","observation_id":"ced02226-d5e1-4daf-9070-b8fb59ddb0a8","resolution":{"observed_at":"2026-08-04T15:22:55.659623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.662254Z","title":"Measuring weak-to-strong legibility of reasoning models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.662254Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:f37fd3dfa1d7884347b0ce0784738417638e68a5b8dedfb3de47d8fdd3bb4322","observation_id":"27b77f84-96c7-4573-a65a-68ff4c96956a","resolution":{"observed_at":"2026-08-04T15:22:55.662254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.668155Z","title":"Selective classification for deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.668155Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:682506510851f4c4c73763bf18132d4c005ad14383575044b5adc1a5e1009a6a","observation_id":"1e51d651-eda2-4133-ac24-a4090bbc8243","resolution":{"observed_at":"2026-08-04T15:22:55.668155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.670889Z","title":"Selective question answering under domain shift","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.670889Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:16e9e0faff0f71582e9eaba78f8a4d89ca73587237812661e7378cc91ac3f9e3","observation_id":"2bbd4f15-5e8e-4dde-b0cd-b9aee3327416","resolution":{"observed_at":"2026-08-04T15:22:55.670889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.673403Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.673403Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:b5abe996e34a438cee01166f4ddc88832e1b5c1d5647d9c1396c079096f0113d","observation_id":"9137fcb8-3be6-43bf-8ec2-a59b6810b193","resolution":{"observed_at":"2026-08-04T15:22:55.673403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.676415Z","title":"Post-abstention: Towards reliably re-attempting the abstained instances in QA","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.676415Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:d51114700f5e115d73e66f70af827a8084e29b489e395fbfb298d635e0aae657","observation_id":"d1ecc528-7dfe-4465-a29e-dcb142d04643","resolution":{"observed_at":"2026-08-04T15:22:55.676415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-08-09T22:50:03.459615Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-04T15:22:55.678979Z","title":"Understanding intermediate layers using linear classifier probes.arXiv preprint arXiv:1610.01644, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.678979Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:11f73d55aadae420735ba4822c095a2f61c6da7a2553c884fd50c3a8d231b8b9","observation_id":"3c21d660-8403-4a1e-9477-6584cfbadd2a","resolution":{"observed_at":"2026-08-04T15:22:55.678979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.681893Z","title":"What you can cram into a single $&!#* vector: Probing sentence embeddings for linguistic properties","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.681893Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:7c689624201df57ceb37177c2adde1520e848c8c3b6d8f5a94a84c91da0ce142","observation_id":"a5b3e427-3d92-40ff-857b-e043099550bd","resolution":{"observed_at":"2026-08-04T15:22:55.681893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.684606Z","title":"Probing classifiers: Promises, shortcomings, and advances.Computational Linguistics, 48(1): 207–219, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.684606Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:54db90e01384cbd762fd646ee6d02b7d7c05384d4ede78de3f6d48053326c59d","observation_id":"e4c7eac5-c1a8-4b8c-866e-0237616497d1","resolution":{"observed_at":"2026-08-04T15:22:55.684606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.687102Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.687102Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:9bd35b7a0749aecd4404d961dbc90b12f80806b3f6c3b8a5908b17d955f436f4","observation_id":"51cf9d20-99a4-4bfa-856b-4a1a76cf83e3","resolution":{"observed_at":"2026-08-04T15:22:55.687102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-04T15:22:55.689628Z","title":"Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, Zico Kolter, and Dan Hendrycks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.689628Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:45e54118bcc07f18cde9edfa7271d3609eda203990bc3bdb0f0a6ae645f49dd2","observation_id":"5dbfacce-095a-4e25-a322-d302c24fd408","resolution":{"observed_at":"2026-08-04T15:22:55.689628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05488","last_updated":"2026-05-28T15:25:50Z","snapshot_observed_at":"2026-08-16T03:54:05.056674Z","submitted_at":"2026-03-05T18:55:16Z","title":"Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05488","snapshot_observed_at":"2026-08-04T15:22:55.692309Z","title":"Reasoning theater: Disentangling model beliefs from chain-of-thought, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.692309Z"},"links":{"cited_paper":"/paper/2603.05488","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:f58d823d77374e3c44e88c9deeadfeab7953ec8730252ede5fdebc2eed8e7eac","observation_id":"6fc31e30-c431-4330-9f14-5a07614571ab","resolution":{"observed_at":"2026-08-04T15:22:55.692309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.694887Z","title":"Catching rationalization in the act: Detecting motivated reasoning before and after CoT via activation probing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.694887Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a96f7ba5751926db70b5e098db55de590c0f89ce83f961e00c9f513766c644c5","observation_id":"128f845d-abca-4eb0-8cff-572e2d44cd27","resolution":{"observed_at":"2026-08-04T15:22:55.694887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.697699Z","title":"Can LLMs predict their own failures? self-awareness via internal circuits,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.697699Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:d450cd193e896452f5e37c2edeff6d780adc610985fc25353cb7d332cf197575","observation_id":"553a984d-8060-496d-b3fb-d9e8d817bdaf","resolution":{"observed_at":"2026-08-04T15:22:55.697699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.703232Z","title":null,"venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.703232Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e491840d8681bf5652baa602d8006df4944599c82dabc5629043aa9b43ed4f25","observation_id":"1fb32995-7a31-4b13-bee8-d60196feb79b","resolution":{"observed_at":"2026-08-04T15:22:55.703232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15842","last_updated":"2025-08-19T18:20:38Z","snapshot_observed_at":"2026-08-16T00:01:49.230361Z","submitted_at":"2025-08-19T18:20:38Z","title":"Lexical Hints of Accuracy in LLM Reasoning Chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15842","snapshot_observed_at":"2026-08-04T15:22:55.705722Z","title":"Lexical hints of accuracy in LLM reasoning chains.arXiv preprint arXiv:2508.15842, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.705722Z"},"links":{"cited_paper":"/paper/2508.15842","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:49c4866977411a73433e6da34e1dd1c360bdb406f57847ef421f8f13175d8853","observation_id":"7fa0ea57-4e87-4d6d-ab0a-7fa9a9957c7a","resolution":{"observed_at":"2026-08-04T15:22:55.705722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.708609Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.708609Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:2183599da51396f9cffb4f55aab66b1c3ec4b2ba7c8c4a44c741889009893ddb","observation_id":"f50feb57-7cfa-40dc-b940-c4f52dfef437","resolution":{"observed_at":"2026-08-04T15:22:55.708609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.711440Z","title":"Cohere’s embed models: details and application","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.711440Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:33480d9ea1b8fb055d8021dc9d5f3a9604fe21f82f1187023c0a088bf8bcd432","observation_id":"55d4a926-5ff9-411e-8ea0-cd4757ef639c","resolution":{"observed_at":"2026-08-04T15:22:55.711440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.717254Z","title":"Bag of tricks for efficient text classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.717254Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:321a1d26cb1234115860964d471f68fdfcb0e95863c15f0515d88edefae421f9","observation_id":"e09c6ee7-226e-4fb6-9f28-dd3a366f1009","resolution":{"observed_at":"2026-08-04T15:22:55.717254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11055","last_updated":"2022-09-22T14:48:11Z","snapshot_observed_at":"2026-08-16T16:30:35.776642Z","submitted_at":"2022-09-22T14:48:11Z","title":"Efficient Few-Shot Learning Without Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11055","snapshot_observed_at":"2026-08-04T15:22:55.720055Z","title":"Efficient few-shot learning without prompts, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.720055Z"},"links":{"cited_paper":"/paper/2209.11055","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:b7b09ada9f5ba5fcfbf60bed126ab8967c9944f9ff64d0663f9861603dc5b24a","observation_id":"b31ef1b5-be68-4428-9359-8161787a2b71","resolution":{"observed_at":"2026-08-04T15:22:55.720055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.722875Z","title":"Ma- tryoshka representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.722875Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:30ee83e17301dcc3b7e42807350b73a4dfb56955d10cc53d66ab1fac16835859","observation_id":"023b3a8f-f40a-4cfa-b264-9767a7fd109c","resolution":{"observed_at":"2026-08-04T15:22:55.722875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.714464Z","title":"Accessed 2026-05-12","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.714464Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8ec0775b400b8d60aff203b090a6810d84fea1e2eb2e9f0a43ecfaa66c2bc244","observation_id":"9f456af3-86a9-40a0-a709-5e0595d9c956","resolution":{"observed_at":"2026-08-04T15:22:55.714464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.728237Z","title":"Task prompt:","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.728237Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:34797e6919ce7470380ac58919312149f5736fb87384bc31dbaf2040eaccb485","observation_id":"8a3d63aa-70c5-43bc-afc0-142966bf912a","resolution":{"observed_at":"2026-08-04T15:22:55.728237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.725637Z","title":"Cohere Embed v4 model parameters for Amazon Bedrock.https://docs.aws.amazon","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.725637Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:0cca69eada7a433095dae5a1568acf87d5e93fdf17328a962f0d85c0a7ed21e3","observation_id":"dc37a3c5-5168-4efe-9585-d90f0ea45894","resolution":{"observed_at":"2026-08-04T15:22:55.725637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.640919Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.640919Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:042e538e859f27eb791c5cd3bf93271eeaeb2cca6abf5f64eb3e4008b89839ec","observation_id":"73985422-df85-4de7-a118-8b29d80e8f3c","resolution":{"observed_at":"2026-08-04T15:22:55.640919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.700408Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.700408Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:4bf8aaf9c41836f6170fae67fb9b7bfceab60c22bbe29c3075d5e4f57a4c12be","observation_id":"b310046e-0b9c-4079-8694-d3b6bee995cd","resolution":{"observed_at":"2026-08-04T15:22:55.700408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20508","last_updated":"2026-06-02T07:42:23Z","snapshot_observed_at":"2026-08-21T07:36:07.204114Z","submitted_at":"2026-03-20T21:23:29Z","title":"Measuring Weak-to-Strong Legibility of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.20508","snapshot_observed_at":"2026-08-04T15:22:55.664897Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.664897Z"},"links":{"cited_paper":"/paper/2603.20508","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:ac326b86302566073fef5cbbf9b148f1502d247148a49102e351a2cbf7fd500b","observation_id":"4a502dba-f086-44ab-a5fb-40a1dea5224f","resolution":{"observed_at":"2026-08-04T15:22:55.664897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T06:16:12.008084Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2608.02089."}