Pith. sign in

Paper Citation Record · LEDGER

On Prompt-Driven Safeguarding for Large Language Models

As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2401.18018.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2401.18018 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 21 of 21 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T11:01:28.960192Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

5
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 0de766c3-c60f-451e-94c9-6ae8a1726782 · inbound

Refusal in Language Models Is Mediated by a Single Direction cites this paper.

Refusal in Language Models Is Mediated by a Single Direction On Prompt-Driven Safeguarding for Large Language Models

Reference 206

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T10:47:56.174132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-13T10:47:55.934081Z digest=sha256:bddf1f4497811d48ab924523a3c95ccadd40e21387108bcf2f9c06fb006f8564

Observation 377af2ab-81c0-42a1-a840-06d03b8365ca · inbound

Jailbreak Attacks and Defenses Against Large Language Models: A Survey cites this paper.

Jailbreak Attacks and Defenses Against Large Language Models: A Survey On Prompt-Driven Safeguarding for Large Language Models

Reference 118

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T02:20:44.509404Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-15T02:20:44.368219Z digest=sha256:aef15052bd736eb7857ed720f85465e23552fa1c248e5e1095e1812758d39bdc

Observation 0e74ee48-9eb7-4872-8849-0398cf4b24bf · inbound

On Mechanistic Circuits for Extractive Question-Answering cites this paper.

On Mechanistic Circuits for Extractive Question-Answering On Prompt-Driven Safeguarding for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T11:01:28.960192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T11:01:28.960192Z digest=sha256:aa667bdf8652f532aee60bdb12b754eb83dcec04d817a9ed1f54bba7d1491149

Observation 77e6bcea-72a4-4f40-aedc-3c1047fb9f50 · inbound

COSMIC: Generalized Refusal Direction Identification in LLM Activations cites this paper.

COSMIC: Generalized Refusal Direction Identification in LLM Activations On Prompt-Driven Safeguarding for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:35:39.020367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:35:39.020367Z digest=sha256:0fdb262e09ed300c6423e284c601777113f9c6115b2325d3fac45358e407cf20

Observation da8b92c4-2591-4935-b4ff-28cb1244cdb6 · inbound

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction cites this paper.

ReGA: Model-Based Safeguard for LLMs via Representation-Guided Abstraction On Prompt-Driven Safeguarding for Large Language Models

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T11:37:16.008776Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-19T11:34:09.428653Z digest=sha256:ebef335b1561474760a8a495e35ab0a87c18230c33d14965552d63c79f36fe62

Observation 36cde0a9-52cb-47df-8885-9a0c480d83cd · inbound

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning cites this paper.

Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning On Prompt-Driven Safeguarding for Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T19:57:44.717885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T19:57:44.717885Z digest=sha256:396c320b18c6a8b5729729a53b3ce273301fecde2d230c0bc5dcafbd4c35a983

Observation c46fd5ac-48fa-416e-9127-e34bc783e919 · inbound

Defending Against Prompt Injection With a Few DefensiveTokens cites this paper.

Defending Against Prompt Injection With a Few DefensiveTokens On Prompt-Driven Safeguarding for Large Language Models

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:32:44.096157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:32:44.096157Z digest=sha256:0360daae7b98d47a9fc63829abe3857a563fac9babfcd6ac1da92f748de166f8

Observation 408b7a6e-c13e-4e9d-85a8-fd40974b14f4 · inbound

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning cites this paper.

Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning On Prompt-Driven Safeguarding for Large Language Models

Reference 197

Resolution
unresolved
no resolver link, observed 2026-08-06T04:47:25.678524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T04:47:25.678524Z digest=sha256:66777de1857baca1f180527159f422c72dc5c04b7dab8db53f7b1c7b7fc55982

Observation c96e3b12-54fb-4287-967a-e210244f832d · inbound

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection cites this paper.

Turning the Spell Around: Lightweight Alignment Amplification via Rank-One Safety Injection On Prompt-Driven Safeguarding for Large Language Models

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T14:57:12.969212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T14:57:12.969212Z digest=sha256:19b4e19ab66487e030409cded6064012f5cf1833bb57ac445c0c7c8ac94405be

Observation af93b3cf-a963-466e-813d-761b4e2907a2 · inbound

Probing the Difficulty Perception Mechanism of Large Language Models cites this paper.

Probing the Difficulty Perception Mechanism of Large Language Models On Prompt-Driven Safeguarding for Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T11:17:49.954144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:17:49.954144Z digest=sha256:28a37ddf6cd068f6604fb13bfb43925d53d0a4a0e781f0b84232632153c8e477

Observation 9629203d-6a04-42d9-ba97-2cbeaf89f271 · inbound

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks cites this paper.

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks On Prompt-Driven Safeguarding for Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T09:40:47.454032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:40:47.454032Z digest=sha256:87f357c18e21b76d1094e38dea4ec2b29d5670b88a086c06e802b2c18cccd372

Observation b4569ed4-f15f-4ffc-8149-6e402c9d083f · inbound

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses cites this paper.

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses On Prompt-Driven Safeguarding for Large Language Models

Reference 245

Resolution
unresolved
no resolver link, observed 2026-08-04T09:25:58.615053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T09:25:58.615053Z digest=sha256:8e4d2caa8bf9f6cc79d7dbac777206081297d7681c34432690b3a40e49e1a714

Observation afa072e4-9ff1-4b24-850d-2432afd9bbf9 · inbound

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing cites this paper.

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing On Prompt-Driven Safeguarding for Large Language Models

Reference 67

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T08:17:36.688250Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-16T08:12:55.296932Z digest=sha256:f6f1c0949cd0479b11666c30b18589e1495c628fe902c9bb98ec8794a7f9eec1

Observation 9d5160d1-3eed-4b90-a28b-f1a98939264c · inbound

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment cites this paper.

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment On Prompt-Driven Safeguarding for Large Language Models

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T06:50:42.968338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-16T06:48:35.723474Z digest=sha256:4ba3acd0dd25848fed5bd90db6e8c1385d9438db4021234fa1049bb395cc38e0

Observation a8bc067e-a858-481a-a400-4b0f18743e42 · inbound

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs cites this paper.

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs On Prompt-Driven Safeguarding for Large Language Models

Reference 131

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T05:35:57.513789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-10T18:04:05.157103Z digest=sha256:966000272a981af44a4b7bc47b0caa331067dbb05707664dc722ce0eb76ec824

Observation c8a09e59-74ee-4937-83ad-b7ada4e165b4 · inbound

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models cites this paper.

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models On Prompt-Driven Safeguarding for Large Language Models

Reference 17

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T01:46:14.370017Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-12T01:41:44.898358Z digest=sha256:ccfcf62380c1553767f02485f61152677b834887df58cf1bc3d06f15f6d025de

Observation 155d4921-eef9-4a92-9c50-46cb5fab9cf2 · inbound

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving cites this paper.

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving On Prompt-Driven Safeguarding for Large Language Models

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:58:24.670438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-20T14:58:03.757712Z digest=sha256:b1519adff5b32bc67140e3908e810b10f6fbc060e8608e8ee45a038686a47492

Observation a30150e8-b607-4b84-bdb7-75acaad5a53b · inbound

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction cites this paper.

Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction On Prompt-Driven Safeguarding for Large Language Models

Reference 59

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T10:58:13.540944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-05-20T10:57:40.997128Z digest=sha256:308e7f633d6cc8a0be973afcbde3074c27c3e4c784ba188639cebfe6927eabd2

Observation 16e62ae5-3a5f-4a29-94b2-79b8b61791a7 · inbound

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness cites this paper.

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness On Prompt-Driven Safeguarding for Large Language Models

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-06-27T03:30:26.970938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-27T03:24:24.714121Z digest=sha256:7dc9193ac5d0bc3c8f54cac1ffff1932dc74438fdfe8ed5d7417c248d8f76365

Observation e2fbc2da-a71e-4a66-933c-d61fc06f346f · inbound

Visual Token Compression Enhances Robustness of MLLMs cites this paper.

Visual Token Compression Enhances Robustness of MLLMs On Prompt-Driven Safeguarding for Large Language Models

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-01T13:10:37.718031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T13:10:37.718031Z digest=sha256:b32217ee4025cb4e8753343775c5ab7bce94f1162796c2b640b912e8284bfc8e

Observation 7b1d80d9-b084-414a-9a8f-51ecc7ee23d1 · inbound

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates cites this paper.

Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates On Prompt-Driven Safeguarding for Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T16:32:06.278220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:32:06.278220Z digest=sha256:a37c04f2226e995f6ad793a2478b28a9e7419b0b06e582085a9501ae30e82934