Pith. sign in

Paper Citation Record · LEDGER

SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 55 inbound Pith citation observations for arXiv:2402.05044.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2402.05044 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 55 of 55 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T22:17:07.384006Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T04:09:34.829805Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 0f840343-e05c-4f98-b0ef-1094684dc243 · inbound

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs cites this paper.

WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:25:14.860999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-17T16:25:14.744887Z digest=sha256:f37a20cdc7d7747cff6dc858f39431a7b18a37abb6a53d6d3d0bbc2e2bf641cf

Observation 18fb40ce-f64f-42aa-94c8-84d37dc436fd · inbound

ShieldGemma: Generative AI Content Moderation Based on Gemma cites this paper.

ShieldGemma: Generative AI Content Moderation Based on Gemma SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-20T13:17:39.519538Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T13:17:39.444002Z digest=sha256:3ddbf546f8afef598566bda3088bcff8cb13d4ed5dbdb420a225c821f6c9b5ba

Observation 90d8e3c8-4f2f-4112-b717-4f6ae335f782 · inbound

ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain cites this paper.

ChemSafetyBench: Benchmarking LLM Safety on Chemistry Domain SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-12T14:13:29.934618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T14:13:29.934618Z digest=sha256:043ba790bd622e76b0d4b237e50ae20791a34f36e0adb18b4554fd4dc4800202

Observation c9feef76-95fb-417d-a443-fc4d3c4a12a7 · inbound

VLSBench: Unveiling Visual Leakage in Multimodal Safety cites this paper.

VLSBench: Unveiling Visual Leakage in Multimodal Safety SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-12T05:56:46.443739Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T05:56:46.443739Z digest=sha256:2042de0f424a350ec4b63174e7d37f2ca96f1f6fefc16cf112b07898dc98fda6

Observation 48c215e3-41d3-4839-9c02-73e7c764ba4f · inbound

Lightweight Safety Classification Using Pruned Language Models cites this paper.

Lightweight Safety Classification Using Pruned Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T13:11:27.272180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T13:11:27.272180Z digest=sha256:966dd6a2427bc0d0eaba525be196453007cf6bee112c4ae8e252b7d4403016c4

Observation 42ba8dac-baab-4d56-93c4-e2db98710fb7 · inbound

Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI cites this paper.

Towards AI-$45^{\circ}$ Law: A Roadmap to Trustworthy AGI SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-11T20:13:07.261539Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:13:07.261539Z digest=sha256:d219bfeaadc1499d2808a0663effea926a2281767dba1e58c69faef15f82d080

Observation 73669d92-0844-4c01-b558-5ac258a156ac · inbound

Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models cites this paper.

Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T14:04:52.192614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T14:04:52.192614Z digest=sha256:5dff70db50e9f8d8ae25638df1c1c887537fbb656906b86066b7b6791e502d90

Observation b679eb1e-a6af-4246-8abd-373faf51d28b · inbound

Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs cites this paper.

Cannot or Should Not? Automatic Analysis of Refusal Composition in IFT/RLHF Datasets and Refusal Behavior of Black-Box LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T05:58:47.068771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T05:58:47.068771Z digest=sha256:3d2cc30c12bac8beaa048a7c5b6f580999f1812f288f94eabe50d11b43aea379

Observation cc2772f1-ecce-42d8-81bf-16bf5208455b · inbound

An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage cites this paper.

An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T22:23:07.633435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:23:07.633435Z digest=sha256:0a30796e8e2e518468a72cda62d2d6b88df879601121c969c42d1e42e5b078aa

Observation 1c6c52ea-5495-427d-b620-6428913a1a76 · inbound

Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values cites this paper.

Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T20:53:59.732280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T20:53:59.732280Z digest=sha256:78307d9dfdd2ad735f1e4a1177669cb65c6ea9fe7da649a5c71a9baba7dedebd

Observation 87a1caa9-b2e8-40d8-924a-017402eaeef5 · inbound

The Dual-use Dilemma in LLMs: Do Empowering Ethical Capacities Make a Degraded Utility? cites this paper.

The Dual-use Dilemma in LLMs: Do Empowering Ethical Capacities Make a Degraded Utility? SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T18:31:03.410535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T18:31:03.410535Z digest=sha256:3fa00c848464202884587910123913872b2f3a7a1296722164d82ee9a3e7ff97

Observation bb969384-9c6c-4882-b7fe-83ea091a5669 · inbound

Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation cites this paper.

Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T04:37:16.968365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T04:37:16.968365Z digest=sha256:7da01ef7bb785a37e311dcd75459b7d1b1738258d794550379d3b8f2b6a45737

Observation 1ca8e0f6-43fb-4a43-981e-d7b41ee7c37a · inbound

o3-mini vs DeepSeek-R1: Which One is Safer? cites this paper.

o3-mini vs DeepSeek-R1: Which One is Safer? SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T23:32:16.795095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T23:32:16.795095Z digest=sha256:ec8873115ec350db2226c8f36e2977cafde33b0088c4d8512902dfb42795aecb

Observation 3de26fcb-5bcd-45b2-afd1-e7c91484d7ce · inbound

Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing cites this paper.

Vulnerability Mitigation for Safety-Aligned Language Models via Debiasing SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T13:14:34.043782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T13:14:34.043782Z digest=sha256:0b555913688d5ce697bb70e4de4d019bd96167ad8a327f9914bccf39a70c2133

Observation 7fea5de3-51c3-4359-be01-e5b890660e00 · inbound

Survey on AI-Generated Media Detection: From Non-MLLM to MLLM cites this paper.

Survey on AI-Generated Media Detection: From Non-MLLM to MLLM SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 193

Resolution
unresolved
no resolver link, observed 2026-08-08T21:12:23.245210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T21:12:23.245210Z digest=sha256:0297e79b90484d3f14d1005014005c68a391d1ec1c7d75166d4ca08894ac2b5c

Observation 3b5c0a1c-1092-451e-abaf-5fcbafeda044 · inbound

Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring cites this paper.

Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-08T21:06:55.943327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T21:06:55.943327Z digest=sha256:50820f7062d9aea4b2f299547cf803de60203a75eb3adc8271ada11086639590

Observation e76e2382-4f89-44d7-bde0-4974df77e60f · inbound

Concept-Level Explainability for Auditing & Steering LLM Responses cites this paper.

Concept-Level Explainability for Auditing & Steering LLM Responses SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-15T22:17:07.384006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:17:07.384006Z digest=sha256:672358a74cd8b474f1566231d81ae0ce43469d4b0227439a3f7521a566e2a308

Observation fc51a2f1-175b-4da0-8f6a-44ff4eb32ce7 · inbound

Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security Perspective cites this paper.

Can You Really Trust Code Copilots? Evaluating Large Language Models from a Code Security Perspective SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T21:14:02.359957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:14:02.359957Z digest=sha256:cc6e27adf708c46eeebe59c7a16d56b9f1c0f874a9beaee6fc1b2c238a6748c1

Observation 99ec4a73-7b09-4444-af12-1e58b91d8d04 · inbound

GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning cites this paper.

GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T21:05:17.450679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T21:05:17.450679Z digest=sha256:9aa1880039a88b05c7882844b42e6fb34832398133fbce915d6ee59f29a2e5b3

Observation 7e09b11c-0844-42b0-9106-664da1d3e6ec · inbound

SweEval: Do LLMs Really Swear? A Safety Benchmark for Testing Limits for Enterprise Use cites this paper.

SweEval: Do LLMs Really Swear? A Safety Benchmark for Testing Limits for Enterprise Use SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T14:52:28.676227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:52:28.676227Z digest=sha256:04ea0da57e2e11cef55b8c3bea2b69f78f0d0bf39a001d2038221516c20f3fab

Observation 82b7de15-ee32-4e31-a2d7-80d1c29af714 · inbound

SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts cites this paper.

SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:28:25.012173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:28:25.012173Z digest=sha256:147592a40c66bbb679af1d5ba2e7d4a6386b5fdd990a30110878cb816f0b7d3a

Observation afdd77a0-996b-4739-bb66-7546694a0b4e · inbound

JavelinGuard: Low-Cost Transformer Architectures for LLM Security cites this paper.

JavelinGuard: Low-Cost Transformer Architectures for LLM Security SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:41:25.431089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:41:25.431089Z digest=sha256:622fd2cebbf0fbab16035b047c7863b2df01a176215ebc8dda3fda833661ac01

Observation d7eb6bf1-2690-4630-8596-899c53113dab · inbound

The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs cites this paper.

The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T10:17:26.810690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:17:26.810690Z digest=sha256:4055dfe41198e4037bd713b65da9e311ea48bcf4055b1636bdbd8f81a773c263

Observation 7a90c41f-4898-42d3-86d6-c6a44e90120a · inbound

Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models cites this paper.

Q-resafe: Assessing Safety Risks and Quantization-aware Safety Patching for Quantized Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-06T23:00:19.566396Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:00:19.566396Z digest=sha256:4588304d1340b41724c52b3fc8035c4fbd543cfdd9d81bbbe342db1fee2ccdf7

Observation f19f1ff8-ae1f-48e5-9ba7-d3826bd5e83a · inbound

Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report cites this paper.

Frontier AI Risk Management Framework in Practice: A Risk Analysis Technical Report SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T15:14:22.874665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:14:22.874665Z digest=sha256:01b507ed0e153dda9df7f16912ff3a3635490a18149d0438159299d4f8bb0785

Observation 1f89ed07-990b-4cfc-8f93-ba7549c2b795 · inbound

Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment cites this paper.

Layer-Aware Representation Filtering: Purifying Finetuning Data to Preserve LLM Safety Alignment SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T18:13:58.160012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T18:13:58.160012Z digest=sha256:65c98bb68a0d4d2874207b63295b0827e35c0000c90eeedeb8f607eae035ca2b

Observation eec8030b-3e91-463e-90c1-c70534844788 · inbound

Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges cites this paper.

Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-06T14:13:06.208065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T14:13:06.208065Z digest=sha256:ff62b160bef07e07c524ad1b908273c3d573a0e6f3494f3eedba96b09acd797c

Observation d5639a06-d99e-4775-809d-bcfd832a40ca · inbound

Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs cites this paper.

Poison Once, Refuse Forever: Weaponizing Alignment for Injecting Bias in LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T16:51:54.798464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:51:54.798464Z digest=sha256:898960d454df90ec5e8b733b3dd54b9a5a902a33fa024d45b97fb59b170a4bcc

Observation f4c98dc4-5aa3-46e1-ac3b-58ba065cbbcb · inbound

YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models cites this paper.

YouthSafe: A Youth-Centric Safety Benchmark and Safeguard Model for Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T19:55:56.522947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T19:55:56.522947Z digest=sha256:4e88851b3ac5615aa503125f72a5fbe1c1a46d34ea20dd6953e8841175b21ddd

Observation 972a1b0d-36e4-471e-b410-e679f75519cd · inbound

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs cites this paper.

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-21T19:00:30.338878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-21T18:58:53.183734Z digest=sha256:2d3c9bf6535c2b5f848fb9d2c4827bd787c740876123cae074f9be4e5cfda598

Observation 6a2660ee-d8d2-4ed6-b36d-a678614671f2 · inbound

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment cites this paper.

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-16T06:50:43.017079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-16T06:48:35.723474Z digest=sha256:6ecb9e80424365afc57cae2e04f9ac07854a855c84c6ac26cfebaffa8684aaa1

Observation 7a8368d9-5b16-46fd-b3c4-72ad86130f73 · inbound

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control cites this paper.

Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-22T11:21:29.020678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-22T11:17:03.104902Z digest=sha256:e48a94189c0df40ceff9131e5ea8ba4290f1c6a1fe83bcf6a04ae48b4f009730

Observation 2b64827f-1289-4556-bf5f-c59ed996b449 · inbound

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning cites this paper.

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T23:32:41.600436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T23:32:41.600436Z digest=sha256:679a81157401a37d040e2214535a1c7f39508f8214b18bc9649a02da14a51610

Observation 613023cc-c79d-4550-9c8c-0912cc952b54 · inbound

The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training cites this paper.

The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:45:50.699060Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T18:18:56.476698Z digest=sha256:2520664e54efee463f520260ea885ba5d58cd147cbbd9d1526e25d275692d1e9

Observation 563312bb-96a9-48ba-9bf2-729dc1470fe8 · inbound

Towards Understanding the Robustness of Sparse Autoencoders cites this paper.

Towards Understanding the Robustness of Sparse Autoencoders SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-10T05:46:10.249715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T05:44:24.532548Z digest=sha256:c7366d33d5289618c8b61a0fda4b6e51b4717fb8686510db38bedeb10b846847

Observation 33c36e59-155a-486b-acc1-7b6a8bfe9746 · inbound

How Sensitive Are Safety Benchmarks to Judge Configuration Choices? cites this paper.

How Sensitive Are Safety Benchmarks to Judge Configuration Choices? SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 8

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T21:56:34.962018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-08T03:41:32.338529Z digest=sha256:590c05bb58de607266085cb2975f514fb850a992e82191214eb7e0cd75d5f32c

Observation 875a15c0-8eb0-4689-8f14-fe3629542743 · inbound

ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts cites this paper.

ARMOR 2025: A Military-Aligned Benchmark for Evaluating Large Language Model Safety Beyond Civilian Contexts SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:26:09.513310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-09T20:00:56.184891Z digest=sha256:89520abd21e481256a5bc9f07cfd72ee095eb5cf49ee95a47eae037502b63fe2

Observation 2fd35a25-d2b1-4cb9-9fc5-e917b618f618 · inbound

A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts cites this paper.

A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:40:43.434098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-08T18:11:29.066362Z digest=sha256:e8ddf3eb69892685dbc4bfea6228ff38d93ab86a51ffe37d2134801bc1f41621

Observation f8f3cead-2e08-4785-bc15-28674a222cf0 · inbound

Self-Mined Hardness for Safety Fine-Tuning cites this paper.

Self-Mined Hardness for Safety Fine-Tuning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-09T06:30:42.600506Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-08T18:23:49.808496Z digest=sha256:65235197f7519307087da691e829caa88376380d39982fb96361b9c673afb05f

Observation 24fe3dff-2570-45cf-8743-48858c046d7b · inbound

Self-Mined Hardness for Safety Fine-Tuning cites this paper.

Self-Mined Hardness for Safety Fine-Tuning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:55:12.268707Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-30T23:56:36.068713Z digest=sha256:1b738903dbd92f76622657b60981545431964f5b9bacdb689f493013eea339f3

Observation 4a77e13d-ee30-4f87-8d68-1f95871f76cb · inbound

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks cites this paper.

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 14

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T05:31:23.783532Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-12T05:28:45.453455Z digest=sha256:25cea6f203be5cbfcc2dd435bcd62a04c44c3bd65f98d62a285bc870a6d8d667

Observation 8d2de4f9-441f-4db0-b09a-3f54c8cda564 · inbound

Non-linear Interventions on Large Language Models cites this paper.

Non-linear Interventions on Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 4

Resolution
metadata mismatch
arxiv_id, observed 2026-06-30T21:05:04.711140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-30T20:58:02.551034Z digest=sha256:a32e3a8dfa69762df624b6e55fcca44d5feebdf9f3b5c769f6b31a945f3d922e

Observation 563b547d-e32c-48f8-937e-31ab7586f894 · inbound

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails cites this paper.

LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-19T23:43:17.817102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-19T23:42:58.135553Z digest=sha256:ceeb18cbfd9f6b19be35d22de72fe6581f5e708370792a874dbd0364368b890c

Observation e7a36fd7-91d7-48cc-950b-2db424c69864 · inbound

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation cites this paper.

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-12T23:33:25.778345Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T23:33:25.778345Z digest=sha256:4324034d763f77e7de9a186a9312c1dab29360052d10bd06ad622b8e22b470f5

Observation 3c81ef08-3245-4c8e-8af3-2801beed71bf · inbound

Robust and Efficient Guardrails with Latent Reasoning cites this paper.

Robust and Efficient Guardrails with Latent Reasoning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 3

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:13:26.928220Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-29T12:07:16.574111Z digest=sha256:4272dd01053cff3e2673331dee4a19a09a98497887168e7395f314e09a071cbc

Observation 89bc2820-8c3c-4ca8-8891-0f95c7c5933b · inbound

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content cites this paper.

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-06-29T09:13:15.996500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-29T09:11:58.843585Z digest=sha256:3b209d2027afae44262f61eaa72c9b0ba6ef380939da38f7d3aef1ac6d07c7b7

Observation b24e9e2e-7335-463a-91b3-05c20ea5b272 · inbound

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning cites this paper.

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-01T19:46:10.195488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T22:09:02.498712Z digest=sha256:0e2b6ec7be5d058b6197b681254a1e1204fd240f314809c4eb131a0fcb4a2dc4

Observation f2b6b5aa-f2cc-4ff8-8adc-704569036dcf · inbound

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment cites this paper.

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 74

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T23:06:20.820913Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-28T14:39:11.178976Z digest=sha256:b387695c02bfec1a6b598970faddae8a5f217c981980aa3af7be0ba6bfb82a0a

Observation 31ebc940-86a9-4941-85f2-25aeb1efc436 · inbound

Gate AI: LLM Security Benchmark Evaluation Methodology and Results cites this paper.

Gate AI: LLM Security Benchmark Evaluation Methodology and Results SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-07-01T22:46:19.208787Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T15:05:08.411286Z digest=sha256:62eeee8d3281a38c04dfb55d75520ac7d573eda65cbee79ee7cc6ee69f300cba

Observation 26ca5bf8-fa3f-48f2-a22f-0e6b9b7fd927 · inbound

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming cites this paper.

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-04T04:09:34.831892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-26T17:11:40.088809Z digest=sha256:8847bdedb74d01b6981429b56023e8193e2c4341fdad774a3894c01c05394b36

Observation d302259a-e3c1-473d-b052-99ec4d22ba88 · inbound

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models cites this paper.

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-07-01T17:35:51.352924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-29T03:35:34.594617Z digest=sha256:bee26b34ff3ef978f0fb7cbf544c70ce3d8d669fb69ecec9fa07d9d65433c144

Observation 1bd7fe88-6b44-44b1-9e7c-c53df2ebe41c · inbound

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B cites this paper.

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T14:52:12.598561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T14:52:12.598561Z digest=sha256:67cbd4ad332f83936c7bece54e49a96d46df82899bf3e1ddfb57eaa871a72706

Observation ef1e49de-c64a-4939-83ff-62027ec1d88c · inbound

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed cites this paper.

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 144

Resolution
unresolved
no resolver link, observed 2026-07-31T09:24:20.719816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-31T09:24:20.719816Z digest=sha256:21dd75cd61553687028bc951fc2b48864052a3c4c2466dff1fcc3a6d3dd76937

Observation fb3ed657-3a93-4523-86b2-2e210f215efb · inbound

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges cites this paper.

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T00:55:22.911556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T00:55:22.911556Z digest=sha256:9cbf33416a60a19392abccf2e6573e46e4bb38bccce3fff6c00509400b4492d3

Observation cfab931d-1af5-4d5b-a163-5258ff903397 · inbound

CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits cites this paper.

CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T15:09:53.306180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:09:53.306180Z digest=sha256:582a66cca402e58c605065df7dab6896b82937eb64954ec93f5152e491dcf630