Pith. sign in

Paper Citation Record · LEDGER

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2509.00373.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.00373 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T13:44:56.708066Z

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-20T19:22:43.082083Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-20T19:23:40.845848Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved23
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b0708b9c-3417-4db4-a5a7-af4755228e2e · outbound

This paper cites Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.560366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.560366Z digest=sha256:4b7c962f7c9924bbc1c6edee830f0eb638c96b0c32ef8df1f389aeca38cf876f

Observation 3227f213-a1aa-4f19-81e2-84ec332bb600 · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.686334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.686334Z digest=sha256:103d82b2818f0b88d9f12c013bcb8764b9e9bbf9128c8d4870b22fb9bb5590dc

Observation abffdf20-d6b4-49db-b979-225b93a0e9c2 · outbound

This paper cites Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.736911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.736911Z digest=sha256:92162948269e4a6acabf0ff42dc013fde9fae1c79381ef3f3e26cdde4dda0604

Observation 348f2d69-e9be-4c67-a1e5-92c1f97f128c · outbound

This paper cites org/abs/2502.01042.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models org/abs/2502.01042

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.911424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.911424Z digest=sha256:58ca3f89df209fab8d3da8802fec25538a6deb3c42c47b9f586bca3f4724cd75

Observation a4ea9379-7816-4e1a-ae76-8f8b17bb589c · outbound

This paper cites Inference-Time Intervention: Eliciting Truthful Answers from a Language Model.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Inference-Time Intervention: Eliciting Truthful Answers from a Language Model

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.970593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.970593Z digest=sha256:cb3a7c50138e87b9f9dfeee1f823ffc50c6f06518221e739ab6012336ef930cc

Observation 4a534b28-1ab2-4c06-b50e-4a969a466e5e · outbound

This paper cites AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.020846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.020846Z digest=sha256:c904cde7fde2b3f6c97c05767a862b0c64dbe9b0ed70400705398faf546c25db

Observation 95ee2fb0-ff21-425e-be10-c99c8bf9b066 · outbound

This paper cites HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.091583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.091583Z digest=sha256:525ef720d3ce858d661d372ade7392dab6efe805de533f6d336512a61cbf8ecd

Observation 3b940c23-c3cf-4361-8f61-dc2aa2003cf5 · outbound

This paper cites Training language models to follow instructions with human feedback.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Training language models to follow instructions with human feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.147734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.147734Z digest=sha256:851eec3e93b146c48913d017969c2b5826ed199d82260cd384ac33ebcb8a2333

Observation 91a1b601-a548-4dff-be26-deed374c2d07 · outbound

This paper cites The Linear Representation Hypothesis and the Geometry of Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models The Linear Representation Hypothesis and the Geometry of Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.199824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.199824Z digest=sha256:0766da0b41bdd2bc64c74731d7aca25f565a423972d33bd41766b01eb91aeecf

Observation 2a5973cb-a02f-4be9-a475-36a9752362cd · outbound

This paper cites Visual Adversarial Examples Jailbreak Aligned Large Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Visual Adversarial Examples Jailbreak Aligned Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.261344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.261344Z digest=sha256:3354609dd16a19c8528563247b825adbb184c4a026feff40bc9d531cbbf7a985

Observation f7401d2b-0a18-4308-9b08-2dd5c8c7f73a · outbound

This paper cites On the Adversarial Robustness of Multi-Modal Foundation Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models On the Adversarial Robustness of Multi-Modal Foundation Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.319661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.319661Z digest=sha256:d215e82d72b08ce1082d38eefef89434ce4bcdbaa5a0e434cece8ec20ec846bb

Observation ddd9d865-c49b-4625-bf38-8cd50f50e119 · outbound

This paper cites Learning to summarize from human feedback.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Learning to summarize from human feedback

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.450480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.450480Z digest=sha256:9be40bb72efd7689c93b00fb3ff3644e8cc60ee50c8a846b2dfb0d3c38333631

Observation 646136b6-51c0-4fa4-95bb-153dfd9e1ad3 · outbound

This paper cites LaMDA: Language Models for Dialog Applications.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models LaMDA: Language Models for Dialog Applications

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.510535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.510535Z digest=sha256:02743f34674dec7e34350db7223265783176bdb11c3ffbbdc22f41ea94e2247c

Observation 0c001538-34a8-42f6-9972-7f97dea0a2fb · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Fine-Tuning Language Models from Human Preferences

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.600389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.600389Z digest=sha256:06a863c171cece92f7cf6760146d0b96be857a4a808d267a45e5b3f0242e33bc

Observation a5373c59-f4d4-4435-8a6e-e0ef15286754 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.661410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.661410Z digest=sha256:9c0b166b828c1ccf0a9e66c6bb2eb9ee0a4ee2519d0ffdfe0c2b1215fd8069bf

Observation 5fbaf813-d142-41e0-8e51-156b1b7b5221 · outbound

This paper cites Understanding and Rectifying Safety Perception Distortion in VLMs.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Understanding and Rectifying Safety Perception Distortion in VLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.708066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.708066Z digest=sha256:357158e3becfca89dfc850d60845326f8a236d71aa76503ebc513fff9f9ec118

Observation 5fedac94-aaaf-46b5-9e1d-666e7eed10a6 · outbound

This paper cites semanticscholar.org/CorpusID:125209808.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models semanticscholar.org/CorpusID:125209808

Reference 1952

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T13:44:57.927865Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T13:44:55.505326Z digest=sha256:2c6fd7e03e24c70ba0438d88f1c29fe8318ae3fc4fbda628d0b1d091e0754729

Observation 7705a784-fd13-4e0a-bbfd-754c2a849208 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Proximal Policy Optimization Algorithms

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:56.384261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:56.384261Z digest=sha256:f99484d64db26dc417a574e9f7be617f94afc5dc9a6bb951876c65956a076241

Observation 11528131-98cc-44e4-9a0f-d85f6e415ec6 · outbound

This paper cites RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.794893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.794893Z digest=sha256:2ea22da1a176567d6743540f265b9fb922d446ec0f078d244c22df72b5cd6083

Observation 6fe0083e-acf1-4012-91ef-9c0ad18e8301 · outbound

This paper cites A General Language Assistant as a Laboratory for Alignment.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models A General Language Assistant as a Laboratory for Alignment

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.370516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.370516Z digest=sha256:35965c1dd07f6ccbb7a7c80660e44676a5ce3c23022c0d20ccec7b5b25b98df1

Observation 997c3dc8-d86b-472d-abb7-23ae05a9a131 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.439302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.439302Z digest=sha256:ac8f18fa4a356961770150a1f7e8f7fc6d89569ffd4d984d3da2c989c56fb668

Observation 4fd7a290-1e3c-4ead-8c4d-74ec6625fbee · outbound

This paper cites MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.630606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.630606Z digest=sha256:3d4d72ffc7c3474ecb174abff73ec52710ab2eb270ab2ee33f479dcb0b807e10

Observation 6cc7a34f-f324-447c-82fc-6cdea44c5e2d · outbound

This paper cites Refusal in Language Models Is Mediated by a Single Direction.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models Refusal in Language Models Is Mediated by a Single Direction

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.307039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.307039Z digest=sha256:02b85870e55d54942fc97ab5cc75ca80af7dc9d19afc05022b6f83c1fca368ac

Observation c4b7143d-a5e2-4c76-abb8-656d7930f615 · outbound

This paper cites FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts.

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T13:44:55.849334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T13:44:55.849334Z digest=sha256:e3b31d71751177b82e723d85b7d0cf60be78b7638211d2191ab4ccc2ad25f1c2

Pith citing papers

Observation f4736f01-8815-4b13-9e3e-564cff6477db · inbound

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models cites this paper.

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-20T19:23:40.847621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T19:22:43.082083Z digest=sha256:906726e31dc54b61c4f20381d027589a8e5560f1369fb5d20cab11004dafa3a4