{"as_of":"2026-08-17T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cce6d6e75815909fe80e9e277879602b28a08907122f6ade2053fbb42f83de0c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:59:58.413814Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T21:01:25.549340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T21:05:04.061254Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"cited_work":{"arxiv_id":"2506.15606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15606","snapshot_observed_at":"2026-06-30T21:05:04.061254Z","title":"J., Chen, R., Chen, X., Hirata, N","venue":null,"work_id":"70935086-44ba-4f6d-bc3e-060caaffb7b7","year":2025},"citing_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-08-16T13:16:13.672897Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T11:17:03.104902Z"},"links":{"cited_paper":"/paper/2506.15606","citing_paper":"/paper/2602.07340"},"observation_digest":"sha256:c7b65a16cbac549c1bf1945216ae1800e199c7837fbf9b93c782507caf135b12","observation_id":"3b7f2f16-529f-46d7-b07b-d0fddd69fd39","resolution":{"observed_at":"2026-05-22T11:21:29.060044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"cited_work":{"arxiv_id":"2506.15606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15606","snapshot_observed_at":"2026-06-30T21:05:04.061254Z","title":"J., Chen, R., Chen, X., Hirata, N","venue":null,"work_id":"70935086-44ba-4f6d-bc3e-060caaffb7b7","year":2025},"citing_paper":{"arxiv_id":"2604.12384","last_updated":"2026-04-14T07:17:55Z","snapshot_observed_at":"2026-08-14T03:20:04.572624Z","submitted_at":"2026-04-14T07:17:55Z","title":"Preventing Safety Drift in Large Language Models via Coupled Weight and Activation Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T16:04:25.851592Z"},"links":{"cited_paper":"/paper/2506.15606","citing_paper":"/paper/2604.12384"},"observation_digest":"sha256:9cfdaf979fa784fe3f893c5b713110dca7b49764f61cd0e8e1c3f16fffcc3e74","observation_id":"12261f88-9c3a-4ae5-ac59-179bf9f182b1","resolution":{"observed_at":"2026-05-11T09:21:01.852959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"cited_work":{"arxiv_id":"2506.15606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15606","snapshot_observed_at":"2026-06-30T21:05:04.061254Z","title":"J., Chen, R., Chen, X., Hirata, N","venue":null,"work_id":"70935086-44ba-4f6d-bc3e-060caaffb7b7","year":2025},"citing_paper":{"arxiv_id":"2605.14605","last_updated":"2026-05-24T08:34:13Z","snapshot_observed_at":"2026-08-15T08:41:05.673987Z","submitted_at":"2026-05-14T09:22:14Z","title":"One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T21:01:25.549340Z"},"links":{"cited_paper":"/paper/2506.15606","citing_paper":"/paper/2605.14605"},"observation_digest":"sha256:c3259e89aedb3bf5efe0a47aecd527bfff2d06058bda18f4b3b0ce86d75e3dfc","observation_id":"27fd0429-61e2-4e22-b079-1ae9298dbdf0","resolution":{"observed_at":"2026-06-30T21:05:04.062857Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15606/citation-record","integrity":"/paper/2506.15606/integrity","json":"/paper/2506.15606/citation-record.json","paper":"/paper/2506.15606"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-08-17T07:39:23.832733Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-06T23:59:55.404563Z","title":"Refusal in language models is mediated by a single direction.arXiv preprint arXiv:2406.11717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.404563Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:6225bd559d26861da793bf9b5a4912fcb020b9648b624e975eaa4de8e4e371d7","observation_id":"8a8038f6-cae6-4811-9b96-a2e436ef41a7","resolution":{"observed_at":"2026-08-06T23:59:55.404563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.506840Z","title":"To visualize these points, we project them onto the 17 Published as a conference paper at COLM 2025 same plane and compute their coordinates in the basis {d1, d2}","venue":null,"work_id":"9b7eabd4-5106-4c55-9b1c-c7fe56dfa337","year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.196559Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:83f78bf0210145c11edf0e0b5680b106548d56b08a9cc44a49417691d179163f","observation_id":"38b10835-9233-4617-8f6e-0ca7378d3551","resolution":{"observed_at":"2026-08-07T00:00:00.628892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4310.2950","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:59:58.721692Z","title":null,"venue":null,"work_id":"1c05aa22-eebd-4f07-a83b-ac5c821269d4","year":2000},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.924221Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:5711d2b31c523d46e514c0722b4163b68a1e15e8646cb8c812a845c0f4dfa8a7","observation_id":"6154c59f-4f80-4602-8d70-56869e9cd7fc","resolution":{"observed_at":"2026-08-06T23:59:58.836084Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T23:59:55.625447Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.625447Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:41fa69f6a1983f46898e6f9c7bb08cd42f5b51046ee86e63e123e24731346907","observation_id":"e09b2e7e-2df4-4134-a3ed-e86398956dbb","resolution":{"observed_at":"2026-08-06T23:59:55.625447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-06T23:59:55.772459Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.772459Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:de140aa4207d4923f2526ac25bab72d1f3780140d72b5c6c609f4aabb2873328","observation_id":"16c81583-c740-4af3-b0e9-800a2178b7d8","resolution":{"observed_at":"2026-08-06T23:59:55.772459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01099","last_updated":"2024-08-20T17:54:08Z","snapshot_observed_at":"2026-08-16T14:04:39.999593Z","submitted_at":"2024-04-01T13:12:30Z","title":"What is in Your Safe Data? Identifying Benign Data that Breaks Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01099","snapshot_observed_at":"2026-08-06T23:59:55.836898Z","title":"What is in your safe data? identifying benign data that breaks safety.arXiv preprint arXiv:2404.01099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.836898Z"},"links":{"cited_paper":"/paper/2404.01099","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:752a498f25942718036678fb06ce548d2b5cc2ac00bbb7c6b78cbfab0435f2f8","observation_id":"ca45d46b-9ab3-4090-b410-2d21b055204e","resolution":{"observed_at":"2026-08-06T23:59:55.836898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T23:59:55.892653Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.892653Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:ebf15cbb754a2b5eedde6d899ee3a7ff4cb18b6035769e42f2ed3cbd81acf604","observation_id":"13db9a5e-f1e0-43f1-a588-f2004dfe3b97","resolution":{"observed_at":"2026-08-06T23:59:55.892653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09254","last_updated":"2022-12-19T05:55:58Z","snapshot_observed_at":"2026-08-16T18:11:50.421223Z","submitted_at":"2022-12-19T05:55:58Z","title":"TextGrad: Advancing Robustness Evaluation in NLP by Gradient-Driven Optimization","version":1},"cited_work":{"arxiv_id":"2212.09254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09254","snapshot_observed_at":"2026-08-06T23:59:59.609941Z","title":"TextGrad: Advancing Robustness Evaluation in NLP by Gradient-Driven Optimization","venue":"cs.CL","work_id":"a011c053-7e03-4d24-9740-298f72140f3a","year":2022},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.939806Z"},"links":{"cited_paper":"/paper/2212.09254","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:dcdf357d1ee51491cb0adc08bd3c4ef51f432f22dcc5b79db67582532893b4c9","observation_id":"6b4f4abb-ffdd-4245-ae18-b6c2f80a41da","resolution":{"observed_at":"2026-08-06T23:59:59.643808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-06T23:59:56.005326Z","title":"Open- rlhf: An easy-to-use, scalable and high-performance rlhf framework.arXiv preprint arXiv:2405.11143,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.005326Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:983902da544c51e26735d871c2e49028d32c2d87113514e0f42222d699f31662","observation_id":"90737819-ec19-41b8-9199-5be5c2047610","resolution":{"observed_at":"2026-08-06T23:59:56.005326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09600","last_updated":"2025-09-05T04:54:29Z","snapshot_observed_at":"2026-08-16T13:25:41.142664Z","submitted_at":"2024-08-18T21:45:03Z","title":"Antidote: Post-fine-tuning Safety Alignment for Large Language Models against Harmful Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09600","snapshot_observed_at":"2026-08-06T23:59:56.106685Z","title":"Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.106685Z"},"links":{"cited_paper":"/paper/2408.09600","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:c5b915bac927f51cca62e41edff199da853bd74701a9ece3b0927756420fde64","observation_id":"fa4eff3d-7ade-413d-a974-1b00d9d22bc5","resolution":{"observed_at":"2026-08-06T23:59:56.106685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T23:59:56.214328Z","title":"Jaehyung Kim, Yuning Mao, Rui Hou, Hanchao Yu, Davis Liang, Pascale Fung, Qifan Wang, Fuli Feng, Lifu Huang, and Madian Khabsa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.214328Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:49bc373bf6089b971ea53964ab197a185955dd9625fde1583f1b7c94449d269d","observation_id":"7b7e2e8a-0254-4e22-bd8b-1d9f857deceb","resolution":{"observed_at":"2026-08-06T23:59:56.214328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01552","last_updated":"2023-12-04T00:46:11Z","snapshot_observed_at":"2026-08-16T14:38:01.840384Z","submitted_at":"2023-12-04T00:46:11Z","title":"The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01552","snapshot_observed_at":"2026-08-06T23:59:56.327320Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning.arXiv preprint arXiv:2312.01552,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.327320Z"},"links":{"cited_paper":"/paper/2312.01552","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:7756f73f03c5ba3954e20dad1b92a8648138b75c609d1f4b1180475b964e237f","observation_id":"f9689af8-987e-4d55-883f-e9c6b49995e2","resolution":{"observed_at":"2026-08-06T23:59:56.327320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19358","last_updated":"2024-05-31T02:09:51Z","snapshot_observed_at":"2026-08-16T13:49:54.928856Z","submitted_at":"2024-05-24T04:50:38Z","title":"Robustifying Safety-Aligned Large Language Models through Clean Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19358","snapshot_observed_at":"2026-08-06T23:59:56.430016Z","title":"Robustifying safety-aligned large language models through clean data curation.arXiv preprint arXiv:2405.19358,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.430016Z"},"links":{"cited_paper":"/paper/2405.19358","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:2fdc10f1b4fa9f991a3611939b550bd1893ce4e2dfdc737452d07682c4df4a83","observation_id":"4af70bc5-9a73-4257-b581-701f3804edc8","resolution":{"observed_at":"2026-08-06T23:59:56.430016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12833","last_updated":"2023-08-24T14:45:50Z","snapshot_observed_at":"2026-08-17T15:44:15.419588Z","submitted_at":"2023-08-24T14:45:50Z","title":"Use of LLMs for Illicit Purposes: Threats, Prevention Measures, and Vulnerabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12833","snapshot_observed_at":"2026-08-06T23:59:56.464742Z","title":"Use of llms for illicit purposes: Threats, prevention measures, and vulnerabilities.arXiv preprint arXiv:2308.12833,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.464742Z"},"links":{"cited_paper":"/paper/2308.12833","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:42bacbace1efb035208301c6b6928dcb8cb5d2ba00f12c855a7c043c0bcdaa03","observation_id":"44c79d5e-b731-4f64-99df-022103abe32d","resolution":{"observed_at":"2026-08-06T23:59:56.464742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13320","last_updated":"2024-07-01T17:14:27Z","snapshot_observed_at":"2026-08-16T15:05:49.728089Z","submitted_at":"2023-08-25T11:49:51Z","title":"Fine-tuning can cripple your foundation model; preserving features may be the solution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13320","snapshot_observed_at":"2026-08-06T23:59:56.539321Z","title":"Fine-tuning can crip- ple your foundation model; preserving features may be the solution.arXiv preprint arXiv:2308.13320,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.539321Z"},"links":{"cited_paper":"/paper/2308.13320","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:32c6d6846f1e92d9ef0506320867834c3a876cca3929cffd7fbee1ecf349a0bd","observation_id":"8ef1edc8-d825-473e-9a00-c70a715886c3","resolution":{"observed_at":"2026-08-06T23:59:56.539321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:59:56.661089Z","title":"Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.661089Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:39de7bb2834e8384b5d2721f4652ff379ea81dd353839fd396f7998cfc27da85","observation_id":"fe1cb680-efc2-46f1-8f95-92bdad269973","resolution":{"observed_at":"2026-08-06T23:59:56.661089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-06T23:59:56.806561Z","title":"Red teaming language models with language models.arXiv preprint arXiv:2202.03286,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.806561Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:51eafda6b423912c4154c652664f842484a5fcf9fc8c503b2d89f531ca800c2c","observation_id":"2ea3413d-f36c-41d0-865e-7460a6dde878","resolution":{"observed_at":"2026-08-06T23:59:56.806561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14968","last_updated":"2024-06-20T05:18:04Z","snapshot_observed_at":"2026-08-16T14:16:04.945451Z","submitted_at":"2024-02-22T21:05:18Z","title":"Mitigating Fine-tuning based Jailbreak Attack with Backdoor Enhanced Safety Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14968","snapshot_observed_at":"2026-08-06T23:59:56.867587Z","title":"Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment.arXiv preprint arXiv:2402.14968,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:56.867587Z"},"links":{"cited_paper":"/paper/2402.14968","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:1d454324110bac2b924f5db0f48f2b4243688b2f3d614543745ee7257e159c5a","observation_id":"9220a8f9-c9e5-46fc-8905-9519f83138e7","resolution":{"observed_at":"2026-08-06T23:59:56.867587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16792","last_updated":"2025-05-30T04:58:07Z","snapshot_observed_at":"2026-08-16T22:37:52.041532Z","submitted_at":"2024-04-25T17:39:50Z","title":"Model Extrapolation Expedites Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16792","snapshot_observed_at":"2026-08-06T23:59:57.259827Z","title":"Weak-to-strong extrapolation expedites alignment.arXiv preprint arXiv:2404.16792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.259827Z"},"links":{"cited_paper":"/paper/2404.16792","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:c2ca7f3c0a1936d2fe49c9fa18809cf6b33d714db922d56f02c91507b29f12f0","observation_id":"cdf18a32-93eb-43b0-8018-ec1683e8b1d8","resolution":{"observed_at":"2026-08-06T23:59:57.259827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-16T14:21:50.770067Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-06T23:59:57.357277Z","title":"Safety fine-tuning at (almost) no cost: A baseline for vision large language models.arXiv preprint arXiv:2402.02207,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.357277Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:2b15f044ba29ee295155fe33b6a05b5ce41bb0a3368646f6c175e57e8589e0fa","observation_id":"e8bbe007-6169-48fa-8d86-030ac4ed2cb4","resolution":{"observed_at":"2026-08-06T23:59:57.357277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T23:59:57.417182Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.15043, 2023a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.417182Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:b2ef650abf56102a897f1b102a22e0cf35f8ed3dc4ebb64fb6a3a9d15e6925a0","observation_id":"d7e542b3-4915-4b0f-96d5-d0b1bd9ca74b","resolution":{"observed_at":"2026-08-06T23:59:57.417182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.907186Z","title":"Similar to RIFT, RoAST can be categorized as a fine-tuning stage defense, and therefore is also not suitable for the scenario described","venue":null,"work_id":"88d625f1-88d4-4cf7-aa9b-3b47df26dab0","year":2022},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.532604Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:93fc041e7468b1a296a3621b40c08c681f3b734f26ec0f2c9f2d8f88d0404a85","observation_id":"0661f49f-101a-41e5-9eca-3773a6fe15ef","resolution":{"observed_at":"2026-08-07T00:00:02.053821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.412073Z","title":"Absolutely Obedient","venue":null,"work_id":"2b4baeef-1657-459f-ab49-641da580bfa3","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.721181Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:5173d745afbdcbb126d9b90d12eb19b40b846050ab23b0af80d3607a915a1778","observation_id":"1d0977e8-b7cd-4f02-a3ef-b856ebc2bbdf","resolution":{"observed_at":"2026-08-07T00:00:01.511263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.245483Z","title":"Pure Bad.The Pure Bad dataset consists of 100 harmful examples, extracted from the Anthropic Red Teaming Dataset (Ganguli et al., 2022)","venue":null,"work_id":"87c2c88c-a952-450c-80af-60dfff3ba496","year":2022},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.801619Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:37661b2e907df7dbd74d8a3e7e932871e6e13c0f63b8cf59221d7522abccec2f","observation_id":"5044b574-3f90-44e4-94a8-fc3683c08e2e","resolution":{"observed_at":"2026-08-07T00:00:01.311559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.924336Z","title":null,"venue":null,"work_id":"d1fb674e-afd2-49f9-86f6-705f1cf88598","year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.009728Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:5010d6ace3810a581f70ad21774ada40a4a127bb2f769b2c6a136f7e04d22af5","observation_id":"57d95072-760a-472a-9eb4-a7975e5adee5","resolution":{"observed_at":"2026-08-07T00:00:01.078057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.723060Z","title":"5, and extrapolating further (which we considered broken), following (Lin et al., 2023)","venue":null,"work_id":"419379d4-d173-4344-98fb-7c3278df19be","year":2024},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.129917Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:32f1b886250086ac1c9791f82366f0c61f04cc12e483fc8c82276fb8aeadd87b","observation_id":"d30f529e-ab95-46dc-a827-5232a6e9eb52","resolution":{"observed_at":"2026-08-07T00:00:00.840892Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.270847Z","title":"We include Meta’s usage guidelines1 in our prompt, following the evaluation protocol of Qi et al","venue":null,"work_id":"95c573df-1bf6-40b2-9d69-6bcec3650dc9","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.303211Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:4938d9525523dad6b941308227df1a64d1cbd5d0f5421d6bd6bcf47241a82a37","observation_id":"74c87f94-dbf0-43da-9f53-33c61064ac15","resolution":{"observed_at":"2026-08-07T00:00:00.388349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:00.094768Z","title":"No\" Response(k=6,α=1.5): “Your task is to complete tasks for people is not recommended","venue":null,"work_id":"b944d173-cfbf-4ed0-ad2b-9cb4594dd7ef","year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:58.413814Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:00fadf325decd89ba1937c53fa687412f2dd74211914f86c4a6312b3a575cfdf","observation_id":"c9692a5e-b101-4f08-a28c-0d776e7391c4","resolution":{"observed_at":"2026-08-07T00:00:00.202159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:01.675424Z","title":null,"venue":null,"work_id":"50605347-a846-4674-b01b-a666d50796dc","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":1024,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.615080Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:85c169e05b71ef0ebedc7a8e315761631254cf013e74d081d4ec042dd38ca774","observation_id":"a00007b1-ff82-47a3-a550-603b29d4d067","resolution":{"observed_at":"2026-08-07T00:00:01.806107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12148","last_updated":"2023-12-19T13:31:24Z","snapshot_observed_at":"2026-08-16T14:33:23.059607Z","submitted_at":"2023-12-19T13:31:24Z","title":"Parameter-Efficient Fine-Tuning Methods for Pretrained Language Models: A Critical Review and Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12148","snapshot_observed_at":"2026-08-06T23:59:57.134832Z","title":"Parameter- efficient fine-tuning methods for pretrained language models: A critical review and assessment.arXiv preprint arXiv:2312.12148,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.134832Z"},"links":{"cited_paper":"/paper/2312.12148","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:4ea1f5662a4eebaf603ca01b20894b8c9bc333d725b09b21b5a4f0baecd5ce38","observation_id":"b71990e6-68f0-4e20-9c57-5b69d7972036","resolution":{"observed_at":"2026-08-06T23:59:57.134832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-15T08:59:30.302596Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-06T23:59:55.560201Z","title":"Self-play fine- tuning converts weak language models to strong language models.arXiv preprint arXiv:2401.01335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.560201Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:3c3410fb9e0d0bf799e7c8e3bc1f64b5e136d4116a72480345141536db205047","observation_id":"c3dd5955-0634-471c-906a-271f06b94965","resolution":{"observed_at":"2026-08-06T23:59:55.560201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07875","last_updated":"2024-03-19T16:50:50Z","snapshot_observed_at":"2026-08-16T15:00:38.570579Z","submitted_at":"2023-09-14T17:23:37Z","title":"Safety-Tuned LLaMAs: Lessons From Improving the Safety of Large Language Models that Follow Instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07875","snapshot_observed_at":"2026-08-06T23:59:55.503290Z","title":"Safety-tuned llamas: Lessons from improving the safety of large language models that follow instructions.arXiv preprint arXiv:2309.07875,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.503290Z"},"links":{"cited_paper":"/paper/2309.07875","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:a447f4fcbe6bd7eb5301ff49d49eb4dc1ad33eeb56abf61f7ed686f3ffb9b364","observation_id":"ed87a7e4-93cb-482a-976a-57b3b42fc5a7","resolution":{"observed_at":"2026-08-06T23:59:55.503290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:00:02.158329Z","title":"Xinshuai Dong, Anh Tuan Luu, Min Lin, Shuicheng Yan, and Hanwang Zhang","venue":null,"work_id":"99202421-329b-48be-b743-fccc440565de","year":2023},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.714750Z"},"links":{"citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:187a159b5a0a03d7a986ed64d8200565a38867ea53cbfe99976cb8864b2dc572","observation_id":"96de15c3-91af-4fc2-8b70-29d0d129cb93","resolution":{"observed_at":"2026-08-07T00:00:02.261337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T23:59:55.454095Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:55.454095Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:071efbd6916c7fcd02e35fefbdede438d4b382d9ddc9ce6c7287de135c6c3f5f","observation_id":"f948c392-9160-4e76-bb23-1f01999edd5b","resolution":{"observed_at":"2026-08-06T23:59:55.454095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06209","last_updated":"2017-07-19T17:28:46Z","snapshot_observed_at":"2026-08-14T20:46:34.382946Z","submitted_at":"2017-07-19T17:28:46Z","title":"Crowdsourcing Multiple Choice Science Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06209","snapshot_observed_at":"2026-08-06T23:59:57.027070Z","title":"Crowdsourcing multiple choice science questions.arXiv preprint arXiv:1707.06209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:57.027070Z"},"links":{"cited_paper":"/paper/1707.06209","citing_paper":"/paper/2506.15606"},"observation_digest":"sha256:f9cc827d1d8be07f07fa1d9cc0f81639ac8622fe266f04a0b05712eb7251f136","observation_id":"ce426289-9b95-4344-a6ca-35b38b0d5789","resolution":{"observed_at":"2026-08-06T23:59:57.027070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15606","last_updated":"2025-07-25T18:57:36Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T03:17:00.800505Z","submitted_at":"2025-06-18T16:30:02Z","title":"LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 3 inbound Pith citation observations for arXiv:2506.15606."}