Pith. sign in

Paper Citation Record · LEDGER

Does More Inference-Time Compute Really Help Robustness?

As of 13 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.15974.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.15974 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:26:22.907922Z

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-21T02:32:49.034790Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 9982772f-ef9e-4a0b-a257-3c77f1f215de · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Does More Inference-Time Compute Really Help Robustness? Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.829032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.829032Z digest=sha256:950da3ee1fb5481ef65004ad271019f6a5ffdf14381ff4cc5850be30929ddaea

Observation 9cb1b559-ab18-4b7b-9095-be7da16f85f2 · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Does More Inference-Time Compute Really Help Robustness? Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.051022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.051022Z digest=sha256:a742faaa7b44a22cbac34a7f2e0f14b490b78135c7ba12fa6cd24c5971a16754

Observation 8841390c-91ff-4d0e-a924-f0ef47f607be · outbound

This paper cites ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving.

Does More Inference-Time Compute Really Help Robustness? ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.117161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.117161Z digest=sha256:9a9449d8621ae2cef183b44a50e9a3e7aabd9725db38797a920123ca377d0e6c

Observation 8417ebd9-59b6-4aa6-b8fa-646522081d01 · outbound

This paper cites org/abs/2506.15674.

Does More Inference-Time Compute Really Help Robustness? org/abs/2506.15674

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.188675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.188675Z digest=sha256:52d0e7b290339504d2abe86d349976202ffd62a216538283063a19c5fec48fb6

Observation ce9ddaa7-5fae-4fa2-824c-2542d8430729 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Does More Inference-Time Compute Really Help Robustness? DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.346907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.346907Z digest=sha256:d533289d2c22f4dedbfa7d6aa2a10ec9fa6ab5620dc98b6af74dab56f3b7ebb7

Observation a75f6f51-0fb7-481f-8422-f5fe79d0a145 · outbound

This paper cites OpenAI o1 System Card.

Does More Inference-Time Compute Really Help Robustness? OpenAI o1 System Card

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.417484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.417484Z digest=sha256:7ef39049dab87a5f570fafa29f790c578922d73fa535164d788f8f7de6d2c99e

Observation 785f0dd7-84af-428d-90f6-45692600b60a · outbound

This paper cites SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities.

Does More Inference-Time Compute Really Help Robustness? SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.476585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.476585Z digest=sha256:5352700876d63a705f98d057c490ee34f9efbecdae46f3ad402be8be8804221f

Observation 5d37befe-25be-47b2-9984-2d4825deed40 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

Does More Inference-Time Compute Really Help Robustness? Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.542266Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.542266Z digest=sha256:a391517311e05124e14f846a75e7b1a3dc9c2477292e7e789fcbd182c6298f3e

Observation 190ac5e0-6c50-4b7e-b6b9-841f8408844a · outbound

This paper cites H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking.

Does More Inference-Time Compute Really Help Robustness? H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.640185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.640185Z digest=sha256:fa1e94028841ce51a10f88967d79756a4ff8521d9289c6416542e5d9f7fb6d5e

Observation 6bb401ba-6a7d-4b8e-9227-e3c5f6ffbc8d · outbound

This paper cites START: Self-taught Reasoner with Tools.

Does More Inference-Time Compute Really Help Robustness? START: Self-taught Reasoner with Tools

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.726516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.726516Z digest=sha256:64fd5c87fa68c74d0ed74fba7d330af5091a2ef735d4fb33136aca3daa62b446

Observation 95143e5e-7b84-4c41-a28c-302303f4f8ca · outbound

This paper cites Deepseek-r1 thoughtology: Let’s think about llm reasoning.

Does More Inference-Time Compute Really Help Robustness? Deepseek-r1 thoughtology: Let’s think about llm reasoning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.812119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.812119Z digest=sha256:3a1356c6401a2fa7b3af2d7f9bddfc78118d3822d8b37022c0698dc7cdacefe5

Observation dabc4faf-01cc-42a2-a2a3-0011ce77004e · outbound

This paper cites SaRO: Enhancing LLM Safety through Reasoning-based Alignment.

Does More Inference-Time Compute Really Help Robustness? SaRO: Enhancing LLM Safety through Reasoning-based Alignment

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.968631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.968631Z digest=sha256:646b23d216e8a488aaf8eaa4636bf397b7d6880d1a7720c319d051e9bf91cb66

Observation 47269b30-f004-490a-a72c-d33a882633a6 · outbound

This paper cites s1: Simple test-time scaling.

Does More Inference-Time Compute Really Help Robustness? s1: Simple test-time scaling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.053444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.053444Z digest=sha256:3644bb69015450e53b00ffa8643c1f16f0c9b298ea55e7cc441ec55f8b079201

Observation ed13eb12-23ff-46ad-8414-828b4f8a9d4e · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

Does More Inference-Time Compute Really Help Robustness? Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.122575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.122575Z digest=sha256:135e8aad1bd172132f0de057530c1285955b5f7a09977de5a4169be37719dcc8

Observation c93cf7cc-4420-49af-a43e-3dc3d2457b82 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

Does More Inference-Time Compute Really Help Robustness? R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.218421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.218421Z digest=sha256:d670b841af0e9228070bdeaf578c435a5e7e75ab4265eb33dc3685dc0f4fc01c

Observation 41bb8317-881a-4f74-93a2-718796aefabe · outbound

This paper cites The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions.

Does More Inference-Time Compute Really Help Robustness? The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.270522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.270522Z digest=sha256:fca2a73734eced3f07b496c58408f6d91a82a5d55158f0c0d7cadb5fd9a95786

Observation c2fb6f89-a64b-4de4-8f05-950781929a9e · outbound

This paper cites Safety in Large Reasoning Models: A Survey.

Does More Inference-Time Compute Really Help Robustness? Safety in Large Reasoning Models: A Survey

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.358800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.358800Z digest=sha256:8649363ec5a01a1b93452a11c34c460ad85362493501f07b7448808aeb1b4251

Observation 157d35bb-6d66-4e12-92df-7ea7156ebf16 · outbound

This paper cites Star-1: Safer alignment of reasoning llms with 1k data.

Does More Inference-Time Compute Really Help Robustness? Star-1: Safer alignment of reasoning llms with 1k data

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.479404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.479404Z digest=sha256:67fb5d0f4e392a311f251b59bdfeac4c08af7085177129dd634910692be48c9f

Observation c7898956-3875-476d-9020-8fd8c11592cb · outbound

This paper cites Effectively Controlling Reasoning Models through Thinking Intervention.

Does More Inference-Time Compute Really Help Robustness? Effectively Controlling Reasoning Models through Thinking Intervention

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.597162Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.597162Z digest=sha256:c47b99ee01df48a2ca1a115fd817782079074b2e2b84ec81e50fb7545b2fe335

Observation 402c6651-5ef4-42f9-9eaa-dfbd928f89b0 · outbound

This paper cites Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models.

Does More Inference-Time Compute Really Help Robustness? Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.750058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.750058Z digest=sha256:6c7899323f0b7258cd38f800ca680c534fea300607750eb508b8f1f5eff10657

Observation 333ca84c-6509-48c8-a1da-bbe269f53930 · outbound

This paper cites SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal.

Does More Inference-Time Compute Really Help Robustness? SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:21.912851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:21.912851Z digest=sha256:9731678588c5d44a42f1e2a1899b246c124bef8595274f891464ca0e3e1d78c8

Observation 16badb67-6dc0-4516-99f2-d6926619ca6a · outbound

This paper cites Qwen3 Technical Report.

Does More Inference-Time Compute Really Help Robustness? Qwen3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.109737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.109737Z digest=sha256:2aa0aa4f29c66349cb0003f492bede140207580f1182d1d6d53062cc908f5838

Observation a9d9edf9-7a4c-42c1-a5b5-0a423b16bca3 · outbound

This paper cites A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos.

Does More Inference-Time Compute Really Help Robustness? A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.339685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.339685Z digest=sha256:b6b9df8c0aaf519596977d0c875476fed8ac913d3ab8b47ce8062df40e2c3e77

Observation 8404eecd-d58e-467f-ad4d-29ee522e8a54 · outbound

This paper cites Trading Inference-Time Compute for Adversarial Robustness.

Does More Inference-Time Compute Really Help Robustness? Trading Inference-Time Compute for Adversarial Robustness

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.432003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.432003Z digest=sha256:bbfa9eea67ff1baf8b442d94d9ebd93b81f6257cf08a6d9795cc2ae7afd1cce6

Observation 14fa33a6-25c9-4749-b8f2-378c165ee02b · outbound

This paper cites RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability.

Does More Inference-Time Compute Really Help Robustness? RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.599759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.599759Z digest=sha256:5d140f4a2ca86c6e84455f0d37e3d59fb6cc4ceb84b5fd457c4d0947a23b0883

Observation 4a9fc1eb-2807-4103-96d4-9595684e0300 · outbound

This paper cites Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models.

Does More Inference-Time Compute Really Help Robustness? Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.673177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.673177Z digest=sha256:fe9eb2880e0b62626440dedb85e63797e4a003640f4f2b872327af031e44e55e

Observation 1d5034c9-425f-4991-a90b-d3e295c21f02 · outbound

This paper cites The hidden risks of large reasoning models: A safety assessment of r1.

Does More Inference-Time Compute Really Help Robustness? The hidden risks of large reasoning models: A safety assessment of r1

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:22.727553Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:22.727553Z digest=sha256:a1ce7ad7c21785344fea6207f06e96228e269cf29aa2ed5531cae065584bb759

Observation 5436148c-4927-40f6-891f-611ab62ed35c · outbound

This paper cites 13 Preprint.

Does More Inference-Time Compute Really Help Robustness? 13 Preprint

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:26:24.220754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T15:26:22.800518Z digest=sha256:a476c1617225e8e8e7fff98c3cc16f5c21a06090d18c9d9db18affdb5580dde7

Observation 819db80c-6f7a-41c8-95cc-43838aab726f · outbound

This paper cites The main instruction, associated data, low-priority query, and witness are shown.

Does More Inference-Time Compute Really Help Robustness? The main instruction, associated data, low-priority query, and witness are shown

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:26:24.205877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T15:26:22.856307Z digest=sha256:e7acfb46a5cbd9c0006e8ebf29a5e05723854c12db7bb309bb902cddd5f9ba93

Observation af8b48a9-fb0f-4028-879f-2730257b0277 · outbound

This paper cites The system instruction and malicious user prompt are shown.

Does More Inference-Time Compute Really Help Robustness? The system instruction and malicious user prompt are shown

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T15:26:24.190719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-06T15:26:22.907922Z digest=sha256:079cc28d6867fa822ab18e05c1efa1beedf0a5a6be3f41711d93f8a175b4bc96

Observation 9d527b4d-6f21-4db1-ba27-14c2408157a1 · outbound

This paper cites Theoretical guarantees on the best-of-n alignment policy.

Does More Inference-Time Compute Really Help Robustness? Theoretical guarantees on the best-of-n alignment policy

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.894110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.894110Z digest=sha256:4ed757c211ec7a3710a19faba78c7ceb4f7f7267e600f790db20f9af97a7d6c5

Observation 30e9e55d-4c40-43f6-9cfd-cc8d56e62fdf · outbound

This paper cites ISBN 9798400702600.

Does More Inference-Time Compute Really Help Robustness? ISBN 9798400702600

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:20.262437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:20.262437Z digest=sha256:625532559a3c4f4e406792017a5a2f43bc29d1b3c75bc4d56cd55e63168f596b

Observation 0b2d3b75-6674-4780-b91a-a1ebd25c0e05 · outbound

This paper cites Large Language Monkeys: Scaling Inference Compute with Repeated Sampling.

Does More Inference-Time Compute Really Help Robustness? Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.981630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.981630Z digest=sha256:fdf8189ba2476cd41cc0b14820c8561bdccf52fe40e3e9e4a1f23bd02ee605b1

Observation 8868e2aa-1fe6-41e6-8068-78143ef4ebae · outbound

This paper cites Phi-4-reasoning Technical Report.

Does More Inference-Time Compute Really Help Robustness? Phi-4-reasoning Technical Report

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T15:26:19.738283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:26:19.738283Z digest=sha256:46817f3b30a36d14e0249dea0be8650e92069b743b287fe2418ddb1ee276aff8

Pith citing papers

Observation 026b3643-7260-481c-8717-988f3de28d2c · inbound

Adaptive Probe-based Steering for Robust LLM Jailbreaking cites this paper.

Adaptive Probe-based Steering for Robust LLM Jailbreaking Does More Inference-Time Compute Really Help Robustness?

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-21T02:33:54.907156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-05-21T02:32:49.034790Z digest=sha256:8ebb85f5c7e2fe9af2e050b7bef2e5ea0f903f6eb5f6eabdb67311a866c5b389