Pith. sign in

Paper Citation Record · LEDGER

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2608.02089.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.02089 v1

Coverage vector

measured 61 of 61 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T15:22:55.728237Z

measured 61 of 61 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

61 of 61 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved60
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a373dd73-b609-4f09-97fd-80d1fbab6cd3 · outbound

This paper cites Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.216027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.216027Z digest=sha256:fadcbd99ca9847b93c21e4d162613244741a86c28a882fe0921b83d96e2888f0

Observation e8199497-cb67-4eed-a4ba-2fb9fa508bdd · outbound

This paper cites Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.308068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.308068Z digest=sha256:dbbcf1b24fdb1068a437f6ff24f5e37c78db7cf696f86514280f17ad85a54904

Observation ba035bc8-4993-4dff-ac0f-280eacbe58e1 · outbound

This paper cites Monitoring monitorability.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Monitoring monitorability

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.415009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.415009Z digest=sha256:7f516bd17191e5c95b7b36189e9c78d06d861c87faa24d071a83360431151c30

Observation f4d9de79-eb3e-4151-8588-b0e7e667031c · outbound

This paper cites Learning to reason with LLMs.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Learning to reason with LLMs

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.498886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.498886Z digest=sha256:5ed16f7427d832fd86943778e07f959ab58151438fce24199d84b59ecad772d3

Observation 00dd6d45-59b4-434d-bdba-bdad35b6d4d9 · outbound

This paper cites Reasoning models.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Reasoning models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.583556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.583556Z digest=sha256:8e568b911099435b7cc6ea79d47dcb3b9d9ed5aabbc9ab8d617d73f587b8d8e7

Observation 8fc9aca7-83dd-4247-8d85-cc1216172457 · outbound

This paper cites Gemini thinking.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Gemini thinking

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.689330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.689330Z digest=sha256:56b0b5f6e56803341918bc56853ff727db3a24535bfaeb1a54022d2575ac7249

Observation f2f15e35-9ecf-4171-b629-6090ef04fc9e · outbound

This paper cites Extended thinking.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Extended thinking

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.764693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.764693Z digest=sha256:04649263ef1809292477643fdd9e3047d6da7128b9fbb3bc32afcabffeb56d27

Observation 8ee19f08-34c6-4dcc-902d-64bca9bf7e06 · outbound

This paper cites Detecting misbehavior in frontier reasoning models.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Detecting misbehavior in frontier reasoning models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.853124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.853124Z digest=sha256:b34bb5d5ce95ae238eed4304700c6d5b9e36542863daedbb4cfe59d76ec5a977

Observation 8a84790b-1427-421b-8fef-1e05d624f26f · outbound

This paper cites Evaluating chain-of-thought monitorability.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Evaluating chain-of-thought monitorability

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:54.926117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:54.926117Z digest=sha256:c99fcc6d79e1ef0a21bfc6fac144e45e2856948c790ed1422f8f0cc206384540

Observation 1d31e4bc-575d-4e23-ae8b-65a98f9702fe · outbound

This paper cites Weinberger.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Weinberger

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.004805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.004805Z digest=sha256:dfb38cc621ad037a7e5c604a1e05d2f2a7b5d9e092b50d9b4ae76e3fc3a69730

Observation e3830b88-790d-46b6-a444-51592cf03256 · outbound

This paper cites Language Models (Mostly) Know What They Know.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Language Models (Mostly) Know What They Know

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.096165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.096165Z digest=sha256:08bf422ce7a741480cc84a10c9e665ae20b157cc864105490563fd9bbef5e79e

Observation 670ec74b-dca9-47c8-a921-a4b1b4dc5314 · outbound

This paper cites Discovering latent knowledge in language models without supervision.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Discovering latent knowledge in language models without supervision

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.139696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.139696Z digest=sha256:8d26f959c69a0d728a37cec46d487cd7e28ed07e6d9954115ad505f4f023b306

Observation 9a60e5fd-6ff8-4cf1-82f8-481d7bc715e7 · outbound

This paper cites The internal state of an LLM knows when it’s lying.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models The internal state of an LLM knows when it’s lying

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.232820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.232820Z digest=sha256:e6494407674fb7cfc60c14cb5cfe9e8150dbb5ab71ff174561c3f5834cf2bb35

Observation f8de3072-45d2-49d5-bdb2-b18bc8598df4 · outbound

This paper cites Qwen3 model collection.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Qwen3 model collection

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.266444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.266444Z digest=sha256:94bbc506cb9574c6a0ecd113da0b4a93196386b3dae1c7a1ce3ebebc86129b82

Observation fbf82d27-7fd1-43e1-a317-6855fc7398c7 · outbound

This paper cites Qwen3 Technical Report.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Qwen3 Technical Report

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.340640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.340640Z digest=sha256:45581af05e68d59e9f7832e75bd45d0ef417b246fc3b2b352fa376f549ce098d

Observation 63c905e8-16e3-4985-928c-ab192a798ba0 · outbound

This paper cites Introducing gpt-oss.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Introducing gpt-oss

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.479309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.479309Z digest=sha256:922aa3604412c4cc27e7724cda43534f442887cbb9e3279a16f59bae2d65fa36

Observation fca9c4e1-5f2f-4d9f-b351-103c57a10434 · outbound

This paper cites gpt-oss-120b & gpt-oss-20b Model Card.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models gpt-oss-120b & gpt-oss-20b Model Card

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.601332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.601332Z digest=sha256:54f180560309344a02cf32b488377e1d258b58ebce32a53e33157a72a081d279

Observation 39e291d4-6ebd-4712-9ce7-047c3036de32 · outbound

This paper cites GPQA: A graduate-level Google-proof Q&A benchmark.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models GPQA: A graduate-level Google-proof Q&A benchmark

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.611081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.611081Z digest=sha256:c86d516b773adcd0bd27db46659d5d806f82ee83a0768eb74ebc3dc260a6de71

Observation 69d9e42c-34f4-49ef-a96f-d119cd9e6672 · outbound

This paper cites MMLU-Pro: A more robust and challenging multi-task language understand- ing benchmark.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models MMLU-Pro: A more robust and challenging multi-task language understand- ing benchmark

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.613881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.613881Z digest=sha256:3886f4b29e28b8e56cbf3dbc2edd95ec60f69dcea90f4cd38c81d33994310030

Observation d26bead1-62ce-4b4b-9afc-07b0f2c4c903 · outbound

This paper cites Benchmarks saturate when the model gets smarter than the judge.arXiv preprint arXiv:2601.19532, 2026.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Benchmarks saturate when the model gets smarter than the judge.arXiv preprint arXiv:2601.19532, 2026

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.616785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.616785Z digest=sha256:96c92e2644f6b3b3759a6f9f044ad432ee2a2909eef0327829122fd76a249a7c

Observation 69bd3f39-8981-4b20-963f-77b5d753461c · outbound

This paper cites Le, and Denny Zhou.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Le, and Denny Zhou

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.619712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.619712Z digest=sha256:b03234a72814e07039e899b22b79d9286e1d3e7881eaf15843321c2b506a9aff

Observation 9285d41e-9d1e-4e76-9931-60e05bacd976 · outbound

This paper cites Large language models are zero-shot reasoners.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Large language models are zero-shot reasoners

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.622234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.622234Z digest=sha256:c44a91fd7498ce79a7309f479ad1e787fc9c8fc6bbd51c765de2b9bdaa887a4d

Observation dd54062b-bbea-4263-b1a7-d638b3788517 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Training Verifiers to Solve Math Word Problems

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.625115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.625115Z digest=sha256:f67b65eace6753ed9c97bd5e239018a2e742f14f7fb2c941e1a3a42565319bbf

Observation 4590fb20-cd6a-4419-9b69-45f05f9bd1b8 · outbound

This paper cites Let’s verify step by step.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Let’s verify step by step

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.627908Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.627908Z digest=sha256:23995de4244859bbfe0f5947019294d4d0b1c8ea671e9589b8b7731267745cb9

Observation 9b3ff758-276c-4af8-addb-b5a0e8efe634 · outbound

This paper cites The relationship between reasoning and performance in large language models–o3 (mini) thinks harder, not longer.Scientific Reports, 16, 2026.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models The relationship between reasoning and performance in large language models–o3 (mini) thinks harder, not longer.Scientific Reports, 16, 2026

Reference 25

Resolution
malformed identifier
no resolver link, observed 2026-08-04T15:22:55.630303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.630303Z digest=sha256:a45bb7793a5138d3456ba9bbd4a0fe7b8c3e8a241a12aee7ad90fe9361527f21

Observation bbe8b4e2-2a48-4e3a-b026-7ade65457f15 · outbound

This paper cites Measuring Faithfulness in Chain-of-Thought Reasoning.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Measuring Faithfulness in Chain-of-Thought Reasoning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.632776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.632776Z digest=sha256:697ec59231a8502f9673ebaf9a71db9c6d8eeb57a5e248a5ec6925afb1313231

Observation 20c34a3c-1df0-497c-82f2-e95c5ac0b4f9 · outbound

This paper cites an unresolved cited work.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.635411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.635411Z digest=sha256:a2a58e04975614003cde681d63b43034003a6bf053a93c09687fca3d4c1a0a55

Observation f5d986b2-c8e4-4cf2-8906-e615e3486f3c · outbound

This paper cites Faithful chain-of-thought reasoning.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Faithful chain-of-thought reasoning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.638176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.638176Z digest=sha256:af95825a45040a547159f8bd5757d2826e2df233731bdd6726921008bcf2e04a

Observation 891febc3-c56d-4222-8264-e34320446d0f · outbound

This paper cites Reasoning Models Don't Always Say What They Think.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Reasoning Models Don't Always Say What They Think

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.643430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.643430Z digest=sha256:514b3a75da4c9558db60441e58a54d9f222cf584362fd8d749492bd7530f21df

Observation 3bd74589-00ab-48b7-abdc-77fd4de9211d · outbound

This paper cites MonitorBench: A comprehensive benchmark for chain-of-thought monitorability in large language models.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models MonitorBench: A comprehensive benchmark for chain-of-thought monitorability in large language models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.646293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.646293Z digest=sha256:9879f9039e92767fc6341dc3f7740fa9b4d8911b297b3313157c834fd0fda76e

Observation 20b9d831-1796-4841-996c-999c335b3812 · outbound

This paper cites Recent frontier models are reward hacking.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Recent frontier models are reward hacking

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.648866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.648866Z digest=sha256:55dd9c88330db77c1a886179144d826e196a42b6e12fc9773ad7eae51e8fa429

Observation 8c240b39-bb8d-4940-955f-43cd49f44316 · outbound

This paper cites Zimmermann, David K.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Zimmermann, David K

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.651357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.651357Z digest=sha256:ad860cda673b8c50e14454d82c7f2822b2f8166821fa202060b555bdcec5a0fa

Observation 0faacaec-9e86-4592-84f2-9481b9a78dd7 · outbound

This paper cites ReasonOps: Operator Segmentation for LLM Reasoning Traces.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models ReasonOps: Operator Segmentation for LLM Reasoning Traces

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.653868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.653868Z digest=sha256:8c5efcc087190ffbd1b31d4c6b699440085a0c101ba88e7176a630ffcefc4a97

Observation 6c431f89-a143-491d-b303-ff92ff1eb2f6 · outbound

This paper cites Length Penalties Make Chain-of-Thought Less Monitorable.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Length Penalties Make Chain-of-Thought Less Monitorable

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.656489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.656489Z digest=sha256:e9dd99861c4e5720ca5062a57a24daf2cd69d9955fba2c8f7c750fc9629f7da5

Observation ced02226-d5e1-4daf-9070-b8fb59ddb0a8 · outbound

This paper cites How to Steal Reasoning Without Reasoning Traces.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models How to Steal Reasoning Without Reasoning Traces

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.659623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.659623Z digest=sha256:249dfb8e0ed7ade61364d8011db227c36d78c089d053718064460ad8038be688

Observation 27b77f84-96c7-4573-a65a-68ff4c96956a · outbound

This paper cites Measuring weak-to-strong legibility of reasoning models,.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Measuring weak-to-strong legibility of reasoning models,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.662254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.662254Z digest=sha256:e53422a1398affcc026a11f37d5e1d28c0b75261d8d1ba9751c6dcbf61e78f0f

Observation 1e51d651-eda2-4133-ac24-a4090bbc8243 · outbound

This paper cites Selective classification for deep neural networks.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Selective classification for deep neural networks

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.668155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.668155Z digest=sha256:66f00e5c6c0663932b1d1ae008faf53bd60d13a2bdfab7b03e43eea7ccf7b918

Observation 2bbd4f15-5e8e-4dde-b0cd-b9aee3327416 · outbound

This paper cites Selective question answering under domain shift.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Selective question answering under domain shift

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.670889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.670889Z digest=sha256:0540d735f8a365fd4696a6839c74e7dfb84cbd1f02e1a8fbc4d75ce214ae8585

Observation 9137fcb8-3be6-43bf-8ec2-a59b6810b193 · outbound

This paper cites an unresolved cited work.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Unresolved cited work

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.673403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.673403Z digest=sha256:d1a36b411b14e1b89f151e83414688e61cc733ffa06ef628a00dc91242bbdb9f

Observation d1ecc528-7dfe-4465-a29e-dcb142d04643 · outbound

This paper cites Post-abstention: Towards reliably re-attempting the abstained instances in QA.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Post-abstention: Towards reliably re-attempting the abstained instances in QA

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.676415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.676415Z digest=sha256:7c5643127d7b33df7f3a1d0c24118791ce3dd4598fc7c96503ed15f59a555325

Observation 3c21d660-8403-4a1e-9477-6584cfbadd2a · outbound

This paper cites Understanding intermediate layers using linear classifier probes.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Understanding intermediate layers using linear classifier probes

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.678979Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.678979Z digest=sha256:84d03d70a365db128e5a7ecea9bb14cbffc34587852fa7be69ff86ae4b6d8257

Observation a5b3e427-3d92-40ff-857b-e043099550bd · outbound

This paper cites What you can cram into a single $&!#* vector: Probing sentence embeddings for linguistic properties.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models What you can cram into a single $&!#* vector: Probing sentence embeddings for linguistic properties

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.681893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.681893Z digest=sha256:74e00a5320a6a294763ea20de9a3b224d6bf9114ecf60696b249e9a4d9e98e6f

Observation e4c7eac5-c1a8-4b8c-866e-0237616497d1 · outbound

This paper cites Probing classifiers: Promises, shortcomings, and advances.Computational Linguistics, 48(1): 207–219, 2022.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Probing classifiers: Promises, shortcomings, and advances.Computational Linguistics, 48(1): 207–219, 2022

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.684606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.684606Z digest=sha256:217441a1dc0f9e52f5113c8b4e4047351037c508d086c8fb89496cd3956d19ad

Observation 51cf9d20-99a4-4bfa-856b-4a1a76cf83e3 · outbound

This paper cites The geometry of truth: Emergent linear structure in large language model representations of true/false datasets.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models The geometry of truth: Emergent linear structure in large language model representations of true/false datasets

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.687102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.687102Z digest=sha256:0b367d4a2162a82c54353873d6372e77065bbc64dbeea5a105b188adbf60595d

Observation 5dbfacce-095a-4e25-a322-d302c24fd408 · outbound

This paper cites Representation Engineering: A Top-Down Approach to AI Transparency.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Representation Engineering: A Top-Down Approach to AI Transparency

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.689628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.689628Z digest=sha256:347af77847b8054d1c2995b7c994b62340d68077e7ed7f6f4866b439c6d5269d

Observation 6fc31e30-c431-4330-9f14-5a07614571ab · outbound

This paper cites Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.692309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.692309Z digest=sha256:65220c60c82aef4728433104104f4997173453f11700570174e6a91a0169169a

Observation 128f845d-abca-4eb0-8cff-572e2d44cd27 · outbound

This paper cites Catching rationalization in the act: Detecting motivated reasoning before and after CoT via activation probing.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Catching rationalization in the act: Detecting motivated reasoning before and after CoT via activation probing

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.694887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.694887Z digest=sha256:6dce6715259ab85a0cfc98df0ef9cd2a92529843571e74d16cf615a56b448041

Observation 553a984d-8060-496d-b3fb-d9e8d817bdaf · outbound

This paper cites Can LLMs predict their own failures? self-awareness via internal circuits,.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Can LLMs predict their own failures? self-awareness via internal circuits,

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.697699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.697699Z digest=sha256:c985236bdbe81614ebf07b1d136b064db0c1906b5e946102855fa82048366d81

Observation 1fb32995-7a31-4b13-bee8-d60196feb79b · outbound

This paper cites an unresolved cited work.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.703232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.703232Z digest=sha256:e17e3003c3590c34c189c75e09c7749c67cebb807f4779e62a719ddb8cad5493

Observation 7fa0ea57-4e87-4d6d-ab0a-7fa9a9957c7a · outbound

This paper cites Lexical Hints of Accuracy in LLM Reasoning Chains.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Lexical Hints of Accuracy in LLM Reasoning Chains

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.705722Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.705722Z digest=sha256:ae64286dd5b705fd4f0b651b610b5a807759234c7d301161a378faf513567c68

Observation f50feb57-7cfa-40dc-b940-c4f52dfef437 · outbound

This paper cites Sentence-BERT: Sentence embeddings using Siamese BERT-networks.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Sentence-BERT: Sentence embeddings using Siamese BERT-networks

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.708609Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.708609Z digest=sha256:903f9ae08730dc7dec309c7eb478424f2b33e84a67e82309252094326a2732e2

Observation 55d4a926-5ff9-411e-8ea0-cd4757ef639c · outbound

This paper cites Cohere’s embed models: details and application.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Cohere’s embed models: details and application

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.711440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.711440Z digest=sha256:dcf85e77897a7005fe79abb6e58daf67473cd20ad00fb903088bb06bf97980f2

Observation e09c6ee7-226e-4fb6-9f28-dd3a366f1009 · outbound

This paper cites Bag of tricks for efficient text classification.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Bag of tricks for efficient text classification

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.717254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.717254Z digest=sha256:cbb9b9c2557fba5eff99fe01487b52453b4b19fe8d2a2d3d8335919bd99fea43

Observation b31ef1b5-be68-4428-9359-8161787a2b71 · outbound

This paper cites Efficient Few-Shot Learning Without Prompts.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Efficient Few-Shot Learning Without Prompts

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.720055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.720055Z digest=sha256:cf7dcbbdef58c52f32b24ecf2ac8a3a1a6f9863a0863a907524275031f9ae418

Observation 023b3a8f-f40a-4cfa-b264-9767a7fd109c · outbound

This paper cites Ma- tryoshka representation learning.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Ma- tryoshka representation learning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.722875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.722875Z digest=sha256:a40c852e8df347f2a134c44598f719ae61dea19b394a26cee9f614e5ecf58629

Observation 9f456af3-86a9-40a0-a709-5e0595d9c956 · outbound

This paper cites Accessed 2026-05-12.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Accessed 2026-05-12

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.714464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.714464Z digest=sha256:e19e07fd1ac413148749008e792bf67ac39c844a0d683c5f33a04c02acb49d0d

Observation 8a3d63aa-70c5-43bc-afc0-142966bf912a · outbound

This paper cites Task prompt:.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Task prompt:

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.728237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.728237Z digest=sha256:8f571cfeb4e1cab8aa2dbe5e12512d496745b5413dedfc4e8e20160e04c98cf2

Observation dc37a3c5-5168-4efe-9585-d90f0ea45894 · outbound

This paper cites Cohere Embed v4 model parameters for Amazon Bedrock.https://docs.aws.amazon.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Cohere Embed v4 model parameters for Amazon Bedrock.https://docs.aws.amazon

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.725637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.725637Z digest=sha256:3c9ffd6eb8ca5bf5fedcabc6bfbb03e3a6cc5777553069eb5283b9ae0c142e45

Observation 73985422-df85-4de7-a118-8b29d80e8f3c · outbound

This paper cites an unresolved cited work.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Unresolved cited work

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.640919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.640919Z digest=sha256:97ecd4d0a4ea18cdcc510b6785744ee2c56452c0ada56809cd53f10caa27173a

Observation b310046e-0b9c-4079-8694-d3b6bee995cd · outbound

This paper cites an unresolved cited work.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Unresolved cited work

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.700408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.700408Z digest=sha256:8688e32346474585d446c014a2f24fdab0ad22d667f88dd3355ce331be231ca6

Observation 4a502dba-f086-44ab-a5fb-40a1dea5224f · outbound

This paper cites Measuring Weak-to-Strong Legibility of Reasoning Models.

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models Measuring Weak-to-Strong Legibility of Reasoning Models

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-08-04T15:22:55.664897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T15:22:55.664897Z digest=sha256:a78223886e0115d2b4546b0688a943243de6c8f6ba7f5c171647ddb7d0a221c7

Pith citing papers

No inbound Pith citation observations are available.