{"as_of":"2026-08-16T21:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fe005906a1656080c3619da9eb48498e8cd81c5c1f3ce2f3cfd1f902ebc7269","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:44:56.708066Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T19:22:43.082083Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T19:23:40.845848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"cited_work":{"arxiv_id":"2509.00373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00373","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acti- vation steering meets preference optimization: Defense against jailbreaks in vision language models.arXiv preprint arXiv:2509.00373","venue":null,"work_id":"8128080a-7068-422f-8a0b-7f985976779b","year":null},"citing_paper":{"arxiv_id":"2605.15687","last_updated":"2026-05-15T07:22:43Z","snapshot_observed_at":"2026-08-12T16:37:54.388660Z","submitted_at":"2026-05-15T07:22:43Z","title":"ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T19:22:43.082083Z"},"links":{"cited_paper":"/paper/2509.00373","citing_paper":"/paper/2605.15687"},"observation_digest":"sha256:497c62d1462e25ed7eb8cc6d8b832bb53b7855554b59959f395ece50ef51368f","observation_id":"f4736f01-8815-4b13-9e3e-564cff6477db","resolution":{"observed_at":"2026-05-20T19:23:40.847621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00373/citation-record","integrity":"/paper/2509.00373/integrity","json":"/paper/2509.00373/citation-record.json","paper":"/paper/2509.00373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.00045","last_updated":"2024-07-29T18:19:35Z","snapshot_observed_at":"2026-08-16T13:48:47.000767Z","submitted_at":"2024-05-28T05:10:40Z","title":"Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00045","snapshot_observed_at":"2026-08-05T13:44:55.560366Z","title":"Nicholas Carlini, Milad Nasr, Christopher A Choquette-Choo, Matthew Jagielski, Irena Gao, Pang Wei W Koh, Daphne Ippolito, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.560366Z"},"links":{"cited_paper":"/paper/2406.00045","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:08bcd88c4efe1e68d9d5604f9476c66d079f67fd165206ee7297b2826e289469","observation_id":"b0708b9c-3417-4db4-a5a7-af4755228e2e","resolution":{"observed_at":"2026-08-05T13:44:55.560366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T13:44:55.686334Z","title":"Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.686334Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:ed4bea1c947da5374bfaa37da4e9b054e9b05a50a2b5112d47fe59839fe3b53e","observation_id":"3227f213-a1aa-4f19-81e2-84ec332bb600","resolution":{"observed_at":"2026-08-05T13:44:55.686334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-13T10:17:00.791443Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-05T13:44:55.736911Z","title":"Samuel Gehman, Suchin Gururangan, Maarten Sap, Yejin Choi, and Noah A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.736911Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:8032f5f9f051e3273a05b9b0133918b49bb2b19180ef1031a17cfb3f2f205e55","observation_id":"abffdf20-d6b4-49db-b979-225b93a0e9c2","resolution":{"observed_at":"2026-08-05T13:44:55.736911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:55.911424Z","title":"org/abs/2502.01042","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.911424Z"},"links":{"citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:4bf4a0a3f5dcb8c4ac977ade5bdeef66941f888eef75b82328e1116acaf4b901","observation_id":"348f2d69-e9be-4c67-a1e5-92c1f97f128c","resolution":{"observed_at":"2026-08-05T13:44:55.911424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03341","last_updated":"2024-06-26T14:11:53Z","snapshot_observed_at":"2026-08-13T19:18:46.730073Z","submitted_at":"2023-06-06T01:26:53Z","title":"Inference-Time Intervention: Eliciting Truthful Answers from a Language Model","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03341","snapshot_observed_at":"2026-08-05T13:44:55.970593Z","title":"Qing Li, Jiahui Geng, Zongxiong Chen, Kun Song, Lei Ma, and Fakhri Karray","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.970593Z"},"links":{"cited_paper":"/paper/2306.03341","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:988566547a715f41e72afc6f75fde1856d5578c989ba97896372aa6b7e6f8ef8","observation_id":"a4ea9379-7816-4e1a-ae76-8f8b17bb589c","resolution":{"observed_at":"2026-08-05T13:44:55.970593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T13:44:56.020846Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.020846Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:8499aa2f9ef1174f0034331d275d04997ca5ab7477e1ebf0e0ddd89ea04e26aa","observation_id":"4a534b28-1ab2-4c06-b50e-4a969a466e5e","resolution":{"observed_at":"2026-08-05T13:44:56.020846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-05T13:44:56.091583Z","title":"Zhenxing Niu, Haodong Ren, Xinbo Gao, Gang Hua, and Rong Jin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.091583Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:efa56fd38fecc975b02340aef99b871299262e1c4770c031270b3751d49a8771","observation_id":"95ee2fb0-ff21-425e-be10-c99c8bf9b066","resolution":{"observed_at":"2026-08-05T13:44:56.091583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T13:44:56.147734Z","title":"Kiho Park, Yo Joong Choe, and Victor Veitch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.147734Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:6c4f9f3e01b13166c19935f130b4c7092385c661c162fa4db83fc5afe91c81a0","observation_id":"3b940c23-c3cf-4361-8f61-dc2aa2003cf5","resolution":{"observed_at":"2026-08-05T13:44:56.147734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03658","last_updated":"2024-07-17T22:24:27Z","snapshot_observed_at":"2026-08-13T11:22:49.156950Z","submitted_at":"2023-11-07T01:59:11Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03658","snapshot_observed_at":"2026-08-05T13:44:56.199824Z","title":"Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, and Pra- teek Mittal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.199824Z"},"links":{"cited_paper":"/paper/2311.03658","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:4247e2325c40889156d851ade3afe0996307d737cd6df2c19f1f21b6ca9a68be","observation_id":"91a1b601-a548-4dff-be26-deed374c2d07","resolution":{"observed_at":"2026-08-05T13:44:56.199824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-16T15:21:48.065276Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-05T13:44:56.261344Z","title":"Christian Schlarmann and Matthias Hein","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.261344Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:4f4772f48f5a4b533cc4ae20d48f388f112cc3c69cf37c8a744015f9c3ff3167","observation_id":"2a5973cb-a02f-4be9-a475-36a9752362cd","resolution":{"observed_at":"2026-08-05T13:44:56.261344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10741","last_updated":"2023-08-21T14:09:09Z","snapshot_observed_at":"2026-08-16T15:06:59.098949Z","submitted_at":"2023-08-21T14:09:09Z","title":"On the Adversarial Robustness of Multi-Modal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10741","snapshot_observed_at":"2026-08-05T13:44:56.319661Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.319661Z"},"links":{"cited_paper":"/paper/2308.10741","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:ea4ff9c55357edfb4751ddc1ee55a5d0bd4228590e5dc80dd55b8a0b1f7c9614","observation_id":"f7401d2b-0a18-4308-9b08-2dd5c8c7f73a","resolution":{"observed_at":"2026-08-05T13:44:56.319661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-05T13:44:56.450480Z","title":"Nishant Subramani, Nivedita Suresh, and Matthew E","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.450480Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:da629db22d6989421fe857fdbb1bb775cf8327d2b1d1fbbfca00da0f8a474b2a","observation_id":"ddd9d865-c49b-4625-bf38-8cd50f50e119","resolution":{"observed_at":"2026-08-05T13:44:56.450480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T13:44:56.510535Z","title":"Han Wang, Gang Wang, and Huan Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.510535Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:196ca811f282d0b5b604903621632e2abaddf320d05367230ae40533039f30ea","observation_id":"646136b6-51c0-4fa4-95bb-153dfd9e1ad3","resolution":{"observed_at":"2026-08-05T13:44:56.510535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T13:44:56.600389Z","title":"Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.600389Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:0df3407d7487e21c31f1ed07432b39de03d31ab20214560fc6ed7efab8c3801d","observation_id":"0c001538-34a8-42f6-9972-7f97dea0a2fb","resolution":{"observed_at":"2026-08-05T13:44:56.600389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T13:44:56.661410Z","title":"Xiaohan Zou, Jian Kang, George Kesidis, and Lu Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.661410Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:965db7832b58752834511e769e226a6a2ff767eaf830f396fa449c7f003dde62","observation_id":"a5373c59-f4d4-4435-8a6e-e0ef15286754","resolution":{"observed_at":"2026-08-05T13:44:56.661410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13095","last_updated":"2025-02-18T18:06:48Z","snapshot_observed_at":"2026-08-16T12:57:13.771710Z","submitted_at":"2025-02-18T18:06:48Z","title":"Understanding and Rectifying Safety Perception Distortion in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13095","snapshot_observed_at":"2026-08-05T13:44:56.708066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.708066Z"},"links":{"cited_paper":"/paper/2502.13095","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:1ec6056b3a0fad96cb28993497509f8e7dad31c91ceeee9a59eb1f42db921687","observation_id":"5fbaf813-d142-41e0-8e51-156b1b7b5221","resolution":{"observed_at":"2026-08-05T13:44:56.708066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:44:57.793198Z","title":"semanticscholar.org/CorpusID:125209808","venue":null,"work_id":"937b4002-2284-44d4-bcc5-43551a948247","year":1901},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":1952,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.505326Z"},"links":{"citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:8ea296ae8cb2198fd6c2cb3119c9a29972812b13da79677a1732bae44f4d650e","observation_id":"5fedac94-aaaf-46b5-9e1d-666e7eed10a6","resolution":{"observed_at":"2026-08-05T13:44:57.927865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T13:44:56.384261Z","title":"Nisan Stiennon, Long Ouyang, Jeff Wu, Daniel M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:56.384261Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:a53f057a1622f71520e8953701ad12759a22b4c9e7613cc43859b143049cbdd6","observation_id":"7705a784-fd13-4e0a-bbfd-754c2a849208","resolution":{"observed_at":"2026-08-05T13:44:56.384261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11462","last_updated":"2020-09-25T20:22:26Z","snapshot_observed_at":"2026-08-09T05:10:26.091710Z","submitted_at":"2020-09-24T03:17:19Z","title":"RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11462","snapshot_observed_at":"2026-08-05T13:44:55.794893Z","title":"Yichen Gong, Delong Ran, Jinyuan Liu, Conglei Wang, Tianshuo Cong, Anyu Wang, Sisi Duan, and Xiaoyun Wang","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.794893Z"},"links":{"cited_paper":"/paper/2009.11462","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:60fd87053eb945fcb13d8f5e70ba846580a1a73f21a3f00f49ec0fad50cf70e6","observation_id":"11528131-98cc-44e4-9a0f-d85f6e415ec6","resolution":{"observed_at":"2026-08-05T13:44:55.794893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-05T13:44:55.370516Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.370516Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:09608eb97c94909eb8dd28fd52cca3e2f49eaba9a3793ea19066570a1d7b4864","observation_id":"6fe0083e-acf1-4012-91ef-9c0ad18e8301","resolution":{"observed_at":"2026-08-05T13:44:55.370516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T13:44:55.439302Z","title":"Ralph Allan Bradley and Milton E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.439302Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:725b1adcc3f270e388ebe21e3c557170e86d72129be1692b0e2631d0c8d37d2a","observation_id":"997c3dc8-d86b-472d-abb7-23ae05a9a131","resolution":{"observed_at":"2026-08-05T13:44:55.439302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-05T13:44:55.630606Z","title":"Wenliang Dai, Junnan Li, Dongxu Li, Anthony Tiong, Junqi Zhao, Weisheng Wang, Boyang Li, Pascale Fung, and Steven Hoi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.630606Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:3e7d4978a4acf8b927acf5c325f573cb96456e332e864200a23cc569c2d335f8","observation_id":"4fd7a290-1e3c-4ead-8c4d-74ec6625fbee","resolution":{"observed_at":"2026-08-05T13:44:55.630606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-15T09:21:47.572546Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-05T13:44:55.307039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.307039Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:0059899efd9f859c9de1d66ce6ff2df6675fcb78e877391767c7acb79d25b7c5","observation_id":"6cc7a34f-f324-447c-82fc-6cdea44c5e2d","resolution":{"observed_at":"2026-08-05T13:44:55.307039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-16T14:44:33.111232Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T13:44:55.849334Z","title":"Xingang Guo, Fangxu Yu, Huan Zhang, Lianhui Qin, and Bin Hu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.849334Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:5f97fb07fca88250328f50755b94b746c67bdaba090ff2b34803b3e2b0c32685","observation_id":"c4b7143d-a5e2-4c76-abb8-656d7930f615","resolution":{"observed_at":"2026-08-05T13:44:55.849334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T09:21:27.339042Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2509.00373."}