Pith. sign in

Paper Citation Record · LEDGER

Learning from Mistakes: Can LLM Self-Recover after Misalignment?

As of 7 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2606.00003.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.00003 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-13T18:51:10.298187Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved31
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bdc40f77-d8d7-474f-bb2e-03c83a3cd695 · outbound

This paper cites Bengio, S.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Bengio, S

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:d6de1d2d1950f827851f8b3cbafae8178532fffc8738727773e4539cc5c4e436

Observation 463068a0-b120-4749-8633-2895fb074331 · outbound

This paper cites an unresolved cited work.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:8194fcd067a836f7318b8dce94db7064533f22b3b10be86dd7099e010a86216b

Observation 9981f573-b0ea-4bf6-98ae-a2fa9b8fa245 · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Fine-Tuning Language Models from Human Preferences

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:b70de4673e75800a925767608796c3f0b0f61bc3c20f03e6c5492c1b24e77920

Observation e249103c-ae54-42d1-82d1-4606e40ff225 · outbound

This paper cites Learning to summarize from human feedback.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Learning to summarize from human feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:7b36812a9dd73b1c97b0fb7742783c019211163abab2d0c21e30b3c488fdf92c

Observation 37ed7e39-f930-4f14-b752-6a8ea0069950 · outbound

This paper cites Training language models to follow instructions with human feedback.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Training language models to follow instructions with human feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:4b7189431c1561e98f1c33b250f52b2b78427138954e2537cb3b6aa43b0829b8

Observation 311df508-9ef0-4dfa-b278-44c36dd38923 · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:7f1313d9296137657a4a088dbf319aef9936575842548c913e628e7ef00ffeaf

Observation 44ca9a16-ffa9-4ac3-848b-b4efc6e34630 · outbound

This paper cites Baseline Defenses for Adversarial Attacks Against Aligned Language Models.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Baseline Defenses for Adversarial Attacks Against Aligned Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:21a89e421b84a3cd884d264bbec6ebbcfc39a35ff3a546c59d0dfd72953882d9

Observation 5e6ea70a-49cb-425d-bb61-b5a8cff0c5f5 · outbound

This paper cites Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Defending Against Alignment-Breaking Attacks via Robustly Aligned LLM

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:857daaedef43a01d5f658ec0d980fd76f49383dfb2a12975f612a384ab63be0d

Observation 438d1711-9f9c-4492-a0d8-2e920a86953c · outbound

This paper cites How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:96196c209fb5bf90ef4a00a01b50115a8e29bb26373357427f24c93c28b495db

Observation 7b58b01b-ec55-4260-9669-46bfa00262d1 · outbound

This paper cites an unresolved cited work.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:16b44c53bca76533025dd72d51ace23d612d1116bfb3dd8e18809541feebcdbb

Observation 5c640ea5-1d00-4b98-a867-192691d3310c · outbound

This paper cites Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:7fc9b3426c8d73bc73d8df4eb09805faf7f34de9cdb7cdc972d9235c63e80e71

Observation 62cfdef6-7a62-43b0-bf7f-7c2f9be23ec6 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:eb2ed71f39396ae4bcbd2aebeb49af9f68887cc40904407210c77190e539874f

Observation e28711a1-022a-48a8-919b-5e37e011090f · outbound

This paper cites Towards Scalable Automated Alignment of LLMs: A Survey.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Towards Scalable Automated Alignment of LLMs: A Survey

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:82ea78879c16acf05351325c5ba1ecd20cdae8e794cae0cca7c2fbb078348e2f

Observation 00c58042-158f-4070-9cf8-bd4a1b5f5813 · outbound

This paper cites Introducing v0.5 of the AI Safety Benchmark from MLCommons.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Introducing v0.5 of the AI Safety Benchmark from MLCommons

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:6cad7f73b39a71a0be6e6efbf9988bf190eedc74bf10d6c681135cd52bd7e78b

Observation 084f4c77-a2d6-49cf-b82d-644caaf018a3 · outbound

This paper cites Zheng, W.-L.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Zheng, W.-L

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:3bf62c2225262d4f608b3b757ebb2a26da6101040da622c81144523e749fefd6

Observation 32ae1346-80d1-4a3a-9782-f5207f2deb51 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:1c4f204edfac781448835b2e2afb2c5a0421ae1ebd036b3819a9a58a6197afcb

Observation eb39685d-99f8-4feb-8372-d0c3f3da8c64 · outbound

This paper cites G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:6904bd6fc1a4794dd63c5f70480b78be4e125181de952e52d8c79cd7889ac07e

Observation 99714881-b8ce-445a-a233-d5c2f68a9d37 · outbound

This paper cites Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:a36a910d26b71f6c063651a59778491b2889dd3da3a266ed4d5333f42640fcfd

Observation a9363380-b9c8-4367-8308-1071695bacd0 · outbound

This paper cites Jindal, H.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Jindal, H

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:1081b2ffcec124c3c72f2f910f50bdf9623c27dd70a838bad2e6098f535eaa86

Observation 38d4d4fe-8f22-471a-a6c7-bcee28f88cf5 · outbound

This paper cites an unresolved cited work.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:cf3569016d1c5c57e0818d9837754de41c579da353c352f836e915fea95f5332

Observation 6db26b5f-812e-42eb-a53b-e31c082d7b5c · outbound

This paper cites An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:750abf26fa6cde5d8c0250fd2b883bfcc0b046d3d43df516a207df43dfdf6658

Observation 95c790ca-7fc2-4ab8-9e9c-0e341194407e · outbound

This paper cites A Holistic Approach to Undesired Content Detection in the Real World.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? A Holistic Approach to Undesired Content Detection in the Real World

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:2857ed30285de69f2dae7c9a80461be01998753e7cf2815961c4694dd4d8bd3d

Observation 655ccc02-a165-47fa-9d79-6c4bf50d95ca · outbound

This paper cites Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:8b81139d26cafffefe539e03d3d128b66e980a8523c42ee5e1f02f5b7363c577

Observation cf62a882-9ef5-4ea2-a133-349da1568eb6 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Constitutional AI: Harmlessness from AI Feedback

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:26166cd7a7654b18d05b2f7e59bf131664a55f4cc502f883558c7b7c37bc6de5

Observation 2fb57d64-3300-4884-9ed3-b83beb929b58 · outbound

This paper cites Accessed: 2025.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Accessed: 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:56f4b681ed27a4645b1d86df3522e3c54d9c9f42ade5b63400c80563410b6c59

Observation 34a6731d-7ffc-462b-8994-6888630cd5de · outbound

This paper cites Qwen3Guard Technical Report.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Qwen3Guard Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:08f242e72599241ae8a2ccf4da100b75fd65f74470a23fded0b40800b78b353b

Observation 59eda368-d3f5-41cf-b0ca-105bdbb18c47 · outbound

This paper cites an unresolved cited work.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:4c958342141d659839146d9b3abe7fc624c26acd17d01613248c3e1af8ea8e91

Observation 9946a1cd-f8e2-4ad4-82e5-f7b21607fdff · outbound

This paper cites LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:0e0e4ee76389d9f6c88587bcaf4efae344a9ca35436ecbea5de41d639692adb2

Observation 16631ab4-7ae8-4856-bc12-1ba812be1c5a · outbound

This paper cites Orlando, L.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Orlando, L

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:7c4e6fdf5803d42b88aa64bc1e3feea61be28c9918f5529cae714d35cc0208d4

Observation fb39f707-e20d-455d-82bd-6fa876693a56 · outbound

This paper cites an unresolved cited work.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:c4c45d620cb8412946e3de4bb2f66a35bd81000333e9ec45b1d33a6084bb8a47

Observation 42628723-a748-4437-bd4e-ddb594436e86 · outbound

This paper cites an unresolved cited work.

Learning from Mistakes: Can LLM Self-Recover after Misalignment? Unresolved cited work

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-13T18:51:10.298187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T18:51:10.298187Z digest=sha256:affe92da76b2eb0e799b3c822e6fcb90cc6285e825c7ac306a8d443716baebe8

Pith citing papers

No inbound Pith citation observations are available.