Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links
Paper Citation Record · LEDGER
As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 55 inbound Pith citation observations for arXiv:2402.05044.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-15T22:17:07.384006Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T04:09:34.829805Z
0 of 0 outbound references displayed
External citation measurements
No source-named external measurement is stored.
No outbound reference observations are available for this paper version.
Observation 0f840343-e05c-4f98-b0ef-1094684dc243 · inbound
WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 18fb40ce-f64f-42aa-94c8-84d37dc436fd · inbound
ShieldGemma: Generative AI Content Moderation Based on Gemma SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 90d8e3c8-4f2f-4112-b717-4f6ae335f782 · inbound
ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c9feef76-95fb-417d-a443-fc4d3c4a12a7 · inbound
VLSBench: Unveiling Visual Leakage in Multimodal Safety SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 48c215e3-41d3-4839-9c02-73e7c764ba4f · inbound
Lightweight Safety Classification Using Pruned Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42ba8dac-baab-4d56-93c4-e2db98710fb7 · inbound
Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 73669d92-0844-4c01-b558-5ac258a156ac · inbound
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b679eb1e-a6af-4246-8abd-373faf51d28b · inbound
Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cc2772f1-ecce-42d8-81bf-16bf5208455b · inbound
An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1c6c52ea-5495-427d-b620-6428913a1a76 · inbound
Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 87a1caa9-b2e8-40d8-924a-017402eaeef5 · inbound
The Dual-use Dilemma in LLMs: Do Empowering Ethical Capacities Make a Degraded Utility? SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bb969384-9c6c-4882-b7fe-83ea091a5669 · inbound
Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1ca8e0f6-43fb-4a43-981e-d7b41ee7c37a · inbound
o3-mini vs DeepSeek-R1: Which One is Safer? SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3de26fcb-5bcd-45b2-afd1-e7c91484d7ce · inbound
Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7fea5de3-51c3-4359-be01-e5b890660e00 · inbound
Survey on AI-Generated Media Detection: From Non-MLLM to MLLM SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 193
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3b5c0a1c-1092-451e-abaf-5fcbafeda044 · inbound
Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e76e2382-4f89-44d7-bde0-4974df77e60f · inbound
Concept-Level Explainability for Auditing & Steering LLM Responses SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 66
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fc51a2f1-175b-4da0-8f6a-44ff4eb32ce7 · inbound
Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security Perspective SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 99ec4a73-7b09-4444-af12-1e58b91d8d04 · inbound
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e09b11c-0844-42b0-9106-664da1d3e6ec · inbound
SweEval: Do LLMs Really Swear? A Safety Benchmark for Testing Limits for Enterprise Use SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 82b7de15-ee32-4e31-a2d7-80d1c29af714 · inbound
SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation afdd77a0-996b-4739-bb66-7546694a0b4e · inbound
JavelinGuard: Low-Cost Transformer Architectures for LLM Security SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d7eb6bf1-2690-4630-8596-899c53113dab · inbound
The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7a90c41f-4898-42d3-86d6-c6a44e90120a · inbound
Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 2019
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f19f1ff8-ae1f-48e5-9ba7-d3826bd5e83a · inbound
Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1f89ed07-990b-4cfc-8f93-ba7549c2b795 · inbound
Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation eec8030b-3e91-463e-90c1-c70534844788 · inbound
Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 76
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d5639a06-d99e-4775-809d-bcfd832a40ca · inbound
Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f4c98dc4-5aa3-46e1-ac3b-58ba065cbbcb · inbound
YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 972a1b0d-36e4-471e-b410-e679f75519cd · inbound
Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 6a2660ee-d8d2-4ed6-b36d-a678614671f2 · inbound
f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 7a8368d9-5b16-46fd-b3c4-72ad86130f73 · inbound
Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 2b64827f-1289-4556-bf5f-c59ed996b449 · inbound
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 613023cc-c79d-4550-9c8c-0912cc952b54 · inbound
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 563312bb-96a9-48ba-9bf2-729dc1470fe8 · inbound
Towards Understanding the Robustness of Sparse Autoencoders SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 33c36e59-155a-486b-acc1-7b6a8bfe9746 · inbound
How Sensitive Are Safety Benchmarks to Judge Configuration Choices? SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 875a15c0-8eb0-4689-8f14-fe3629542743 · inbound
ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 2fd35a25-d2b1-4cb9-9fc5-e917b618f618 · inbound
A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation f8f3cead-2e08-4785-bc15-28674a222cf0 · inbound
Self-Mined Hardness for Safety Fine-Tuning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 24fe3dff-2570-45cf-8743-48858c046d7b · inbound
Self-Mined Hardness for Safety Fine-Tuning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 4a77e13d-ee30-4f87-8d68-1f95871f76cb · inbound
Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 14
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 8d2de4f9-441f-4db0-b09a-3f54c8cda564 · inbound
Non-linear Interventions on Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 563b547d-e32c-48f8-937e-31ab7586f894 · inbound
LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation e7a36fd7-91d7-48cc-950b-2db424c69864 · inbound
Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3c81ef08-3245-4c8e-8af3-2801beed71bf · inbound
Robust and Efficient Guardrails with Latent Reasoning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 89bc2820-8c3c-4ca8-8891-0f95c7c5933b · inbound
Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation b24e9e2e-7335-463a-91b3-05c20ea5b272 · inbound
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation f2b6b5aa-f2cc-4ff8-8adc-704569036dcf · inbound
SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 74
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 31ebc940-86a9-4941-85f2-25aeb1efc436 · inbound
Gate AI: LLM Security Benchmark Evaluation Methodology and Results SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 21
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 26ca5bf8-fa3f-48f2-a22f-0e6b9b7fd927 · inbound
FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation d302259a-e3c1-473d-b052-99ec4d22ba88 · inbound
Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1bd7fe88-6b44-44b1-9e7c-c53df2ebe41c · inbound
Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ef1e49de-c64a-4939-83ff-62027ec1d88c · inbound
Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 144
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fb3ed657-3a93-4523-86b2-2e210f215efb · inbound
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cfab931d-1af5-4d5b-a163-5258ff903397 · inbound
CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models
Reference 63
Source-reported events for the cited work
Unavailable: canonical work link unavailable.