Pith. sign in

Paper Citation Record · LEDGER

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models

As of 19 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2412.18171.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.18171 v2

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T05:02:26.737170Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

28 of 28 outbound references displayed

  • verified exact0
  • verified fuzzy4
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c677173e-3af0-4e00-9e18-99c5cee50232 · outbound

This paper cites Jailbreak chat, 2023.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Jailbreak chat, 2023

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:02:27.210335Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:02:26.602837Z digest=sha256:ea25f86b0e7c072e0c3ab51256ed3113432e32d36b45e9e60cfe40362f282490

Observation 2bdcac9a-1dcc-40fa-a639-35a2edad71c8 · outbound

This paper cites Many-shot jailbreaking.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Many-shot jailbreaking

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:02:27.193034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:02:26.608044Z digest=sha256:3cca1c97d24dd4667b010926817846309f01fa8103affa97b8056131dd5c6c6a

Observation ed4625c8-4b10-4fcf-99c2-8e9cd67c9e9f · outbound

This paper cites A General Language Assistant as a Laboratory for Alignment.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models A General Language Assistant as a Laboratory for Alignment

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.612486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.612486Z digest=sha256:8dc7094909a5d9d6f7c63f496b2b66ddfd777b09e12102292b0d12ab7c68bf14

Observation 56408827-6197-47a7-9f04-0525fcbcc1d5 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.617889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.617889Z digest=sha256:d7cf1b30daf2d605b2a73de4a2e3724dc84222f7fd05d0c30bb0dbf316105802

Observation ff102511-77bf-4ea2-baf5-28278e09193d · outbound

This paper cites Jailbreaking Black Box Large Language Models in Twenty Queries.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Jailbreaking Black Box Large Language Models in Twenty Queries

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.622921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.622921Z digest=sha256:a5a6b64d66541a75da30e103964668fec6b551905ed0443ee37ea3c765b98b8b

Observation e67b2e6f-940d-4cd7-b311-a9fea92fd7ea · outbound

This paper cites Zico Kolter.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Zico Kolter

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.628462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.628462Z digest=sha256:5a2b06f1acd1d70c88b14987e6249f30ed03fd42698220336b4311f9734c3c2f

Observation 8650b5b1-c9da-4ab9-a493-c439f712182c · outbound

This paper cites Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.636480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.636480Z digest=sha256:4d6920a0d2fa24b095f162ad91bc2bfbd9737bd9159f73c53f827e140f22f460

Observation 645c60a9-f761-4276-8439-7c42712e7687 · outbound

This paper cites Baseline Defenses for Adversarial Attacks Against Aligned Language Models.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Baseline Defenses for Adversarial Attacks Against Aligned Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.641984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.641984Z digest=sha256:20e48503ce1581685263bb1335b9c1ca8ea878bb42333ab0d366dcf909052fcc

Observation 3d791c1c-8193-4918-8d71-e8b36fb2084b · outbound

This paper cites Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.647309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.647309Z digest=sha256:e9f24394685726216d9861ef4ee3bb20a540bb83ca3fe14a2eec3b1ada26f0ff

Observation 97e0fba1-631f-4d0a-8258-a37b74dfb516 · outbound

This paper cites In conversation with Artificial Intelligence: aligning language models with human values.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models In conversation with Artificial Intelligence: aligning language models with human values

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.652362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.652362Z digest=sha256:72d4a77ca91ba5dfbcf72483bc950b6ec7825ac6799682d4645ee511af17fc96

Observation 1c8e2bfd-f142-4877-9547-c03c44f799ff · outbound

This paper cites Certifying LLM Safety against Adversarial Prompting.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Certifying LLM Safety against Adversarial Prompting

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.657326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.657326Z digest=sha256:00818f8d67c45b9150a8359339fa09d82a0aea51edabbd6ed28e742eaef64e44

Observation 7b140455-dd06-4910-b29d-8ab790cfb8e2 · outbound

This paper cites Hashimoto.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Hashimoto

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.662444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.662444Z digest=sha256:ca1cbc3044c07b2e59c62ebf1c2e58d46926fbe5df0db8eb2974ca093ca1b8ab

Observation 075521c8-5206-4dc9-8aef-627e16dff426 · outbound

This paper cites AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.666965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.666965Z digest=sha256:983b3905537091da2adfea5676d21416971b00f2eaba00bbb5de23d8c210717c

Observation a911f54d-ba12-4e5b-8d85-e511243ac224 · outbound

This paper cites Tree of Attacks: Jailbreaking Black-Box LLMs Automatically.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Tree of Attacks: Jailbreaking Black-Box LLMs Automatically

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.671653Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.671653Z digest=sha256:869a447c2d35411e1d0e0ecb595fbed60e41f4569690406dfe290fa0c7a6d51e

Observation 9ad325b4-1779-4699-9b1e-c7a1caff0cd2 · outbound

This paper cites GPT-4 Technical Report.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models GPT-4 Technical Report

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.676403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.676403Z digest=sha256:5270049df083409ed4b3adb0493c6014819ec7196ee83f70297f452b78e4b083

Observation ee63dac9-75b2-40a1-a3c9-fc2b32be6e06 · outbound

This paper cites an unresolved cited work.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.680836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.680836Z digest=sha256:45769e392febf7039307d107b61fead362e130aceec6f0a2e5a10a32a0be8dfc

Observation 6a547d90-4968-4506-bec3-884520f865a9 · outbound

This paper cites SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.685499Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.685499Z digest=sha256:fc44eb11093fc4a1245e5d031a02731e7332fe8fea4748130449b8945a9c8ae9

Observation f71874a8-ebff-49e2-9cef-d38c56c5993a · outbound

This paper cites Meta llama guard 2.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Meta llama guard 2

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:02:27.143996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:02:26.690411Z digest=sha256:fac259b9a10f3a3c649070689a3fc7e9b662839c009f966c18ffdcf2f0b743fe

Observation f3ed272b-8902-4467-8ba7-cbc6f834e443 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.694550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.694550Z digest=sha256:c928d28bdc0c355e8430e79d60e5640cf26f65124fe0f341a8052a9563a3e540

Observation 24f12a02-e1fd-413c-b2b6-125962a7e667 · outbound

This paper cites On adaptive attacks to adversarial example defenses.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models On adaptive attacks to adversarial example defenses

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T05:02:27.127315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-11T05:02:26.699213Z digest=sha256:e246b2f42f6458cf0b7a46da53439bbb521ea68bd39c1e8b84be99eb08d35d6a

Observation c05bef07-2c6a-456a-982d-140b59fd6193 · outbound

This paper cites The Art of Defending: A Systematic Evaluation and Analysis of LLM Defense Strategies on Safety and Over-Defensiveness.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models The Art of Defending: A Systematic Evaluation and Analysis of LLM Defense Strategies on Safety and Over-Defensiveness

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.704127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.704127Z digest=sha256:1169a09b80cfd24ebf5560f1fe24e2d187fda2ea044d937ff91b36be95191dea

Observation d013308c-9204-477e-baa9-9634be07d53f · outbound

This paper cites Jailbroken: How Does LLM Safety Training Fail?.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Jailbroken: How Does LLM Safety Training Fail?

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.708733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.708733Z digest=sha256:01d0449570844c6b13a16eeae654e7b2a497fd4ad39036a1f55dd57d9d7b31b5

Observation 4cfd5c5e-551a-4de1-8066-5a1b12d2d127 · outbound

This paper cites Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.713244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.713244Z digest=sha256:84f8f429a3fe594ec609714327aab3052114d2de838f7c5fa78ba0218c998e10

Observation ca6d1489-5ced-474a-8e7d-577eed24b3d7 · outbound

This paper cites Defending chatgpt against jailbreak attack via self-reminders.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Defending chatgpt against jailbreak attack via self-reminders

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.717626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.717626Z digest=sha256:bd33c7fb8523328ca28a6b1d5df2f662ea9074f67b1b5867ea134f4d3815338e

Observation 96517cfd-8eb1-44e3-9180-34792e08cc7a · outbound

This paper cites Intention Analysis Makes LLMs A Good Jailbreak Defender.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Intention Analysis Makes LLMs A Good Jailbreak Defender

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.721836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.721836Z digest=sha256:ff9ac4fa6eb4200625f8937a4047b1c95ed70dea4a972147072ea136eb1ea56c

Observation aa3158fe-f488-43ef-95d9-92f6ee752848 · outbound

This paper cites Weak-to-Strong Jailbreaking on Large Language Models.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Weak-to-Strong Jailbreaking on Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.726743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.726743Z digest=sha256:6e0104a60906a1acb52dfc0c949f0768b08fc48234dfc1da727065cc43c3e102

Observation da5016f6-9b03-45a2-9b57-6e64ba5be173 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.731586Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.731586Z digest=sha256:71084bcc272b9e056076ca7dac945b9ea8c18bc30a2e070ea563e77aa70312a2

Observation 5c61f57e-1e38-46d9-a149-a2537f73272a · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

Token Highlighter: Inspecting and Mitigating Jailbreak Prompts for Large Language Models Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T05:02:26.737170Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T05:02:26.737170Z digest=sha256:68caf839570208e64a583b09876cfecf4c23ecc309f84c36987144e64b81fb9b

Pith citing papers

No inbound Pith citation observations are available.