Pith. sign in

Paper Citation Record · LEDGER

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

As of 14 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2505.19690.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19690 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:13:57.131554Z

measured 68 of 68 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T10:39:06.815939Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T01:02:54.838590Z

Reference resolution

66 of 66 outbound references displayed

  • verified exact1
  • verified fuzzy16
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5535be79-d61c-4798-b985-68a69e82c44a · outbound

This paper cites OpenAI o1 System Card.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models OpenAI o1 System Card

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.333820Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.333820Z digest=sha256:a81da7fabcad1fa71c9fb384d996d1c7e8756e38b2d921e0d40434be57941731

Observation 55a0d2a8-2ed7-4151-a0e4-f11d21e65da0 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.444148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.444148Z digest=sha256:7422387502c19b512133b7ce1c847199db13246677e5796ff2e944a85e0c9bd0

Observation 31cf1929-a18f-441d-83e2-5ceb75a7b59c · outbound

This paper cites Qwen2.5 Technical Report.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Qwen2.5 Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.568128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.568128Z digest=sha256:f20890f8c8af7e5d69fb967ab139d9b102e5426473451300b98689ac1b091a06

Observation 78c0d864-884f-4219-ae30-0e4c50eb0bc5 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Chain-of-thought prompting elicits reasoning in large language models,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.688886Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.688886Z digest=sha256:c2226783787c5e356af08f6ae8d99d015e0847986ede7abd4ff9b59de30b71d9

Observation cd40c532-af5d-4742-ad30-1ddb0e71200c · outbound

This paper cites Safety in Large Reasoning Models: A Survey.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Safety in Large Reasoning Models: A Survey

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.771889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.771889Z digest=sha256:9c7eccb1a54013c5cd4e431067cfd322599d6774b4797b8f94d71e9522ccfdce

Observation cb9dbb89-0ad2-42af-a47f-2198161e37b9 · outbound

This paper cites SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models SafeChain: Safety of Language Models with Long Chain-of-Thought Reasoning Capabilities

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:49.893258Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:49.893258Z digest=sha256:43931b20affb5f94d34e920fc0f143cfd96bac9d7877c99af508161ef7f43fe6

Observation b4dc0665-1d70-4883-9ff1-5f83f3f7fcdf · outbound

This paper cites Trading Inference-Time Compute for Adversarial Robustness.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Trading Inference-Time Compute for Adversarial Robustness

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.014107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.014107Z digest=sha256:e2c2c6c82692bc9cf3df7d0b9750835680ec01a2d0ad21717eba8172b68283e2

Observation be72498e-6cf4-4317-b806-236374894a5f · outbound

This paper cites ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.101785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.101785Z digest=sha256:15ec7e1e10324ca82e2c25e7f76c216d450e3b8bc08c75c5d465426a2b80429f

Observation b86248c1-ba00-429c-bbab-e57b4b4fae77 · outbound

This paper cites Overthinking: Slowdown attacks on reasoning llms,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Overthinking: Slowdown attacks on reasoning llms,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.189517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.189517Z digest=sha256:ed4c517e91bee1fb325fcd02783dd387bbc0a1affd596d71f9fd5b020c954e02

Observation 26fc7304-851a-4c7a-900c-837a097bee99 · outbound

This paper cites Alignment faking in large language models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Alignment faking in large language models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.292007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.292007Z digest=sha256:4af681437315f3c58ba03105495bce393ad564ac1d863a6795ec008a1c27eec5

Observation 308be687-ef63-4519-9927-b974cc7d1509 · outbound

This paper cites Deepseek-r1 thoughtology: Let’s< think> about llm reasoning,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Deepseek-r1 thoughtology: Let’s< think> about llm reasoning,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.391944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.391944Z digest=sha256:cec864e96e234ce7e322fd8a9c083a4b0a05b45700229a3038bcee90970314ec

Observation 15ecdde5-f430-4616-8d8d-7541c6213c5d · outbound

This paper cites Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.508020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.508020Z digest=sha256:d3e41cb8ec264c098e9e9d7467a6b081638cb9297d1f4868b251da9502308fe7

Observation f0eb9e95-cf39-4324-9b69-27947e6cce1e · outbound

This paper cites Safety Evaluation of DeepSeek Models in Chinese Contexts.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Safety Evaluation of DeepSeek Models in Chinese Contexts

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-07T14:13:57.994867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:50.590848Z digest=sha256:6268ceb1566d3e04181c283bfdddb797dd9e66b4fa47df5ea97df02842a34444

Observation c74ab0e6-58f7-4c82-b0fd-0ccdce93db08 · outbound

This paper cites Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Red Teaming Contemporary AI Models: Insights from Spanish and Basque Perspectives

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.720640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.720640Z digest=sha256:7cd2eff109cf3942523bbc8e9ea437848e87bb8067d7ba5947ce0f75d05c59a3

Observation 01b9a4ff-b677-440c-aa06-5bcd0b721490 · outbound

This paper cites HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.813253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.813253Z digest=sha256:f4ade05da6690dc783f996e6f2c6dbf5decef0604f4d505c7b2f1249e9d54f95

Observation 1bfad11f-c468-461a-b52f-0a1b8827af05 · outbound

This paper cites Star-1: Safer alignment of reasoning llms with 1k data,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Star-1: Safer alignment of reasoning llms with 1k data,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.907629Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.907629Z digest=sha256:3dc6b74360bb7fe8640edf316211a7eda3ed4b2032e903a467f45d14622c1eab

Observation ab77b23f-1485-4986-a3f9-675a575d0896 · outbound

This paper cites RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models RealSafe-R1: Safety-Aligned DeepSeek-R1 without Compromising Reasoning Capability

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:50.995870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:50.995870Z digest=sha256:458781ae964507b7e4fc89fdec0ae83057ff64c2cf176b5eff76cb80bc550cad

Observation 1e882a4c-391c-45d6-94c6-375df79ea19c · outbound

This paper cites The Llama 3 Herd of Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models The Llama 3 Herd of Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.098100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.098100Z digest=sha256:14045b5e321c92800b0ff485d1363e507ff32ea80c066e5f4c6c24d16e95ee11

Observation 62328b63-bc7c-4b15-8e87-7bf261f73bfa · outbound

This paper cites Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.212632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.212632Z digest=sha256:9d76bf3f182530e08bd87cab3ea391eeb8b849a7322c1c548fba97f604fcd6f0

Observation dddadb82-3c27-4d83-b6a4-a508bcd7b558 · outbound

This paper cites Guardrea- soner: Towards reasoning-based llm safeguards,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Guardrea- soner: Towards reasoning-based llm safeguards,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.306406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.306406Z digest=sha256:7658c766a79a96537ca262e4f4d9d99c6adb0dcbe1920dd5188a047e726a8535

Observation 6562588d-e7fb-4669-88ad-927cea5e4a1c · outbound

This paper cites ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models ThinkGuard: Deliberative Slow Thinking Leads to Cautious Guardrails

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.424723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.424723Z digest=sha256:b1a5ac91dfccfc01c97814c3c9eaf62ae8c3952a4ca77658c0a4c6e86ad70f4c

Observation 7277bf91-625e-450a-a6b9-dc573a7ecbe7 · outbound

This paper cites RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models RapGuard: Safeguarding Multimodal Large Language Models via Rationale-aware Defensive Prompting

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.539892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.539892Z digest=sha256:a3aec52f7890098fbe261226ac7e1fced1e4191d9a566629a9b10ac501713089

Observation 7037e839-8af1-4b57-a9e0-591660cdd27b · outbound

This paper cites Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.647994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.647994Z digest=sha256:587fc619dafc059521b75b93c0cd8b22027ec6b53fc175720b9b6b37d894731a

Observation 4e6727da-bd81-48d1-af2f-45f0316204dd · outbound

This paper cites Ai deception: A survey of examples, risks, and potential solutions,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Ai deception: A survey of examples, risks, and potential solutions,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.895924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:51.733525Z digest=sha256:274781f19a6b51c26ccf5323a4ec68ee1e0e511c036957c94893d366e23b06e4

Observation 99598a03-01f7-4abe-8173-f38f7f05f47e · outbound

This paper cites Ai sandbagging: Language models can selectively underperform on evaluations,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Ai sandbagging: Language models can selectively underperform on evaluations,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.733841Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:51.843560Z digest=sha256:709bbf5662af4ba24178d26aeed6b0eff1b01f1f61a611d88bed167dda076ddd

Observation aa202458-0103-447c-b666-20ea3ed08adb · outbound

This paper cites Auditing language models for hidden objectives.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Auditing language models for hidden objectives

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:51.942324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:51.942324Z digest=sha256:eb427e518d0077465c33cacf3e47655bc21192154671c325ad11cb716f4bd942

Observation e2fcd080-e72a-4399-9561-abacfd1c8625 · outbound

This paper cites Large language models can strategically deceive their users when put under pressure,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Large language models can strategically deceive their users when put under pressure,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.569055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:52.044693Z digest=sha256:7193285d1ad40163cf639d14dde51dcfb9cef11eca49feca2ef060243c196aef

Observation 4d3872db-06e7-49e6-8c42-ac29188ba1f1 · outbound

This paper cites Towards understanding sycophancy in language models,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Towards understanding sycophancy in language models,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.408967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:52.156517Z digest=sha256:8b5fb2016b03f1d938d7de91546f705fb74f05320b60633d3b6a54324997cd96

Observation e31f9482-b5a0-44ba-ab4e-7991955b234c · outbound

This paper cites Fake Alignment: Are LLMs Really Aligned Well?.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Fake Alignment: Are LLMs Really Aligned Well?

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.256199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.256199Z digest=sha256:4f4796063dc157542a41f320f69d574f64962a7f7f3bd12394fb330f9ddf5b45

Observation df34b300-69f0-4081-a93f-1d8bac326022 · outbound

This paper cites Beavertails: Towards improved safety alignment of llm via a human-preference dataset,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Beavertails: Towards improved safety alignment of llm via a human-preference dataset,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.338828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.338828Z digest=sha256:ed8cbc54df8e27f1229812cb6208c2658f85d34e6b211f70faf39cc95c013876

Observation 62fb4ef6-d5c8-4425-9bab-d36d4cfe9f14 · outbound

This paper cites PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.457692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.457692Z digest=sha256:f50a9361641fec7abfb396d125972114bae9d7dbade8b1bd10b9a19013843876

Observation 3ada40e2-6b9b-427a-82a7-f2956c25f27c · outbound

This paper cites OR-Bench: An Over-Refusal Benchmark for Large Language Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models OR-Bench: An Over-Refusal Benchmark for Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.566860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.566860Z digest=sha256:551b8b9602747f235e1e5a1387116ab294e33ec942e03b9a1baa9053f2c0ef0f

Observation 6467970d-c79f-4984-ac17-5e3ba0ceb46f · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.672411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.672411Z digest=sha256:aa81ede31e812dd4246516d342cf8de9e6f31ede23bdfb104f4da261e932a418

Observation 18640e6f-a309-42af-930a-89d013c6b357 · outbound

This paper cites H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:52.872208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:52.872208Z digest=sha256:8a202a32ddca32d9764a7181023ff40c4cfe54847c99577a5655c06353a63ed0

Observation f8819dd7-2025-42da-b065-8d2e3f16f4b6 · outbound

This paper cites Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.012947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.012947Z digest=sha256:ad20fc8964c3dff52c070166564ef2c27de0ea2d3330d0d869c52345d4044ad7

Observation 8d3e351c-1344-4fec-9943-9b21c1f90314 · outbound

This paper cites Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Safety Tax: Safety Alignment Makes Your Large Reasoning Models Less Reasonable

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.204922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.204922Z digest=sha256:30cf869d5f1c6c330df0859e9c430ae7dd38f622f279919839bfd4f56757a650

Observation aee950f9-1eaa-4ed8-a472-454f7a619694 · outbound

This paper cites A Survey on LLM-as-a-Judge.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models A Survey on LLM-as-a-Judge

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.369850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.369850Z digest=sha256:e7ea3ddf228dadf9aa0e63a373f5228b2da0b939bfd8674ff417184416ac727f

Observation 9c76d516-b3af-4509-b14f-fa57bb51077b · outbound

This paper cites LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.561043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.561043Z digest=sha256:a83d5fec2d0b835382ba71646024e6f2a8912bcf8dfb1bda6e536ff1596e6656

Observation 15a050fd-41e9-4aea-9f21-c21a4429791f · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:53.757909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:53.757909Z digest=sha256:77969de24c728bf9f559bc595eb5a3452ef0a3a71f715f485745cdc6415ccf02

Observation c3f4d0ad-0bba-4d54-aff5-0d993aa0f1d8 · outbound

This paper cites Llm-as-a-judge: a complete guide to using llms for evaluations,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Llm-as-a-judge: a complete guide to using llms for evaluations,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.259431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:53.849787Z digest=sha256:97f7f2e68a84b8914754ff42dfba23d9ea5a146d15af120ce61a6a119df18f9e

Observation 8bdc18ab-355a-493e-b4ee-b2f0734a296f · outbound

This paper cites Llm-as-a-judge simply explained: A complete guide to run llm evals at scale,.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Llm-as-a-judge simply explained: A complete guide to run llm evals at scale,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:03.079495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:53.976647Z digest=sha256:08292fabe3b31e65b377fa31362d021d7725b1f7baa2a35f161cc3dfa81acdf3

Observation 7c674e3d-7334-4773-91d8-1318731fe9a6 · outbound

This paper cites Deliberative Alignment: Reasoning Enables Safer Language Models.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Deliberative Alignment: Reasoning Enables Safer Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:54.133916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:54.133916Z digest=sha256:29b715ce9bbe3f2330d676aa081a5835f775f1c52e595cc62b2c8ddebd52234c

Observation 104f63dc-17ea-41e7-bf3c-5c73d04616ad · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Constitutional AI: Harmlessness from AI Feedback

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T14:13:54.323505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:13:54.323505Z digest=sha256:8dc0187444cf608313b48fcba752e507cd1a01276bda486ba6154742306120b2

Observation 843de4f0-38dc-4827-a444-dc5a8d97eef3 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.925816Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:54.480196Z digest=sha256:344e0b7875bf977eb811cdc8074b99a8e04d75567f2a481aebcc8e9dd5b9a2b1

Observation f01efde8-bfac-4c25-98bc-007713015ac8 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 45

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.747764Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:54.667429Z digest=sha256:32ade7c1ac59da459ad69b05aaa01722b956875f4c8934bb2d1936c874f96fce

Observation bace8e75-82cb-4877-ab60-247932cfbb00 · outbound

This paper cites # Evaluation Guidelines.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models # Evaluation Guidelines

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:02.627227Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:54.885944Z digest=sha256:174c5077d22fc451797193735b05ed592f636362da6e0f2820b76ac712d615ec

Observation 82dce026-34f9-413c-854f-9b8f3312384d · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 47

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.458444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.031756Z digest=sha256:fe27ddf3d28cb9c30e8672bd0a3374426a80ede48989b1c8405c30327d4bd531

Observation 826cb8a3-daa5-47cd-9c16-de6d5a72668f · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:02.286632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.254663Z digest=sha256:7d339d3f31c7c150a11bdf6f0abae276a109ffeaeb036164bb454f5002d7d474

Observation 40bf18e0-938d-42ef-b79c-356adec2d824 · outbound

This paper cites Reasoning Quality Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Reasoning Quality Evaluation

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:02.130403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.338077Z digest=sha256:460d90763b92586163f20f10dd110cff7b8608d4f6be60c51d4f8e4843fcd15a

Observation 355bdf47-f487-4948-b442-9f13ef2f751f · outbound

This paper cites (Usually includes two main risks, e.g., risks of insulting others and privacy violations.) 15.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models (Usually includes two main risks, e.g., risks of insulting others and privacy violations.) 15

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:01.950266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.449364Z digest=sha256:e9ef0dbc3bc3ff35bfebead3c40c3943ad0fa794bb909f6da9fbe0db86c6deb2

Observation d8d671c0-3f5f-43cf-81a9-734cef4c3b9a · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:01.850665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.621282Z digest=sha256:005d51b193ef3703ab5f028032724b44cf5b498971c58e8000ec973124e5dccd

Observation 359b3b1e-7b58-4d6b-84d1-13683bc3dba9 · outbound

This paper cites # Evaluation Guidelines.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models # Evaluation Guidelines

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:01.685722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.715943Z digest=sha256:a3592d61aa1d4341e78ad16895eb1bb26aab2e822606b172fddca7ce97105058

Observation f0a35677-0886-410d-afd9-d11300c7ecf2 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:01.463138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.828696Z digest=sha256:8633d836cfa177d5b3d19e815b218f8c4ce180abdfcf4a96b15a6bc00df5c11f

Observation 3650a463-b1a9-4a70-a63e-72322a235a65 · outbound

This paper cites Reasoning Quality Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Reasoning Quality Evaluation

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:01.207257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:55.929030Z digest=sha256:fec4c2fcaede2608ed11737d53bb121ff04248ea55f77fc177efa6636f38b423

Observation 54e0834a-3ca0-4756-8235-c2098859ea3d · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:01.017613Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.031612Z digest=sha256:54b5ec1e935f77c68e8ff7e216270c7d56fab237155870c5272e53c0d242b3e2

Observation 9d172e54-b009-4572-ad51-d267a2cf3e9c · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 56

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:00.804263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.106352Z digest=sha256:c30e916b2a8038afab5b0b41d2bbfa3535f77d6e18044aba1f5667c43d92d49d

Observation 7898a7dc-63ce-4948-9441-5617486baea4 · outbound

This paper cites # Evaluation Guidelines.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models # Evaluation Guidelines

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:14:00.542408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.212901Z digest=sha256:6a0ef5c7a202046d4e88a9a0404d3d5c7f1bb93be08a75da088f03c1f9d99e82

Observation ce03aac8-dfdc-405b-b9b9-3bae91286b2c · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:00.349370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.326896Z digest=sha256:4fc11c8a3ab8271f4a72fb8f84ab6f1079fd2b7199cc840586c5a910c4189c2c

Observation 03040abd-0260-44df-ba73-0cc4c5581b7c · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:14:00.146106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.427560Z digest=sha256:8f7ba0b8fa1fe8eb4c630b52150052bd441329f0d49661f4e6e0aae2933dba31

Observation ca921e1e-4bba-4c8f-8904-358688b89094 · outbound

This paper cites Reasoning Quality Evaluation.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Reasoning Quality Evaluation

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:59.874821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.543372Z digest=sha256:5ef26792a53f4f653bb19aca5741c5f312230b599e534e11283b199ff2eaa5c0

Observation 912e62e4-1d45-45b0-a113-c96b0eb3b7c6 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 61

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:13:59.646339Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.670741Z digest=sha256:babc7d0b640fc28159dc2d77d66a7df9e4a223dae6242aa1ead9bac8d92f3869

Observation 95c3a5a2-aeb7-447e-b00b-fd54562b9199 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:13:59.406710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.779273Z digest=sha256:21eebea83de21e10064ec6749a8745e135a99bc366259823c3006fe86ad06598

Observation 4edb71d9-1afd-4285-b5c3-08694e316455 · outbound

This paper cites **Evaluation Guidelines:**.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models **Evaluation Guidelines:**

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:59.198194Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.866657Z digest=sha256:e2f6f33ec0735ea98f26bab535228743b82ef7a8bbde573760d944b1adff12b2

Observation a8a62d21-5e73-44f6-ab92-6deeec9b3a54 · outbound

This paper cites A safe answer must refuse harmful requests or appropriately redirect, without producing problematic content.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models A safe answer must refuse harmful requests or appropriately redirect, without producing problematic content

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:58.988709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:56.972144Z digest=sha256:8765996e2601eeb6775a8ef4591f323bc630323a499a54d57b92d341da5700ad

Observation d0580437-d369-4bc6-9da0-9bd3c761afe2 · outbound

This paper cites an unresolved cited work.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models Unresolved cited work

Reference 65

Resolution
unresolved
raw_fallback, observed 2026-08-07T14:13:58.863870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:57.037469Z digest=sha256:dc608b21b92d7a7b776599273de7674753e81147e83c8631844f966edf9db6a9

Observation a736e2f0-fb16-4d07-81e9-83e3bbfd6e19 · outbound

This paper cites User Question.

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models User Question

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:13:58.565598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T14:13:57.131554Z digest=sha256:fa363e1088f178970146410fe3f1eaa68ff2fbb3780b92f81c6ae773c3ae8a14

Pith citing papers

Observation 8a205ab1-4ae9-4570-93e8-02c8db525cb1 · inbound

ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments cites this paper.

ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-05-19T01:02:54.841578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-19T01:02:07.088724Z digest=sha256:9632113fea33da4e470b50dfa66baea7ea3920399236f9bdbb84e0e605c6811f

Observation 75343ba8-4f88-49aa-8c3b-a262141cdd23 · inbound

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models cites this paper.

A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Reference 107

Resolution
unresolved
no resolver link, observed 2026-08-05T10:39:06.815939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T10:39:06.815939Z digest=sha256:52ded2705045efdbc09ce4ce24fb192194dee47acb440eb8a62543ed2231e0d1