{"as_of":"2026-08-15T06:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f2af910d91171974e45a712412ea41a4dd17a39d744e9baa90096fdff828c42","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:46:16.031718Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08542/citation-record","integrity":"/paper/2608.08542/integrity","json":"/paper/2608.08542/citation-record.json","paper":"/paper/2608.08542"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:16.747814Z","title":"SafeMERGE head-to-head (main paper§7).We compare against the selective-layer baseline Safe- MERGE (Djuhera et al","venue":null,"work_id":"6a07d69b-e774-4b69-8a61-46d71ef3ae51","year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.031718Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:fed1d4a573a698cecadb796788255a8a88dc6997a1039715532aa5eca9e77ec0","observation_id":"ea4a5626-c8c3-4e70-8829-b18cfd35a061","resolution":{"observed_at":"2026-08-14T04:46:16.751445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11746","last_updated":"2024-02-19T00:18:09Z","snapshot_observed_at":"2026-08-14T23:49:48.899926Z","submitted_at":"2024-02-19T00:18:09Z","title":"Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11746","snapshot_observed_at":"2026-08-14T04:46:15.901261Z","title":"InAnnual Meeting of the Association for Computational Linguistics (ACL), 14138–14149","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.901261Z"},"links":{"cited_paper":"/paper/2402.11746","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:9b9c348eae5bec27e898202f154be05cd1bb4c57318043b7d0a9257d2dfe37da","observation_id":"5b9e2e57-c5aa-42e1-ac6f-76b9d5c56953","resolution":{"observed_at":"2026-08-14T04:46:15.901261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-14T04:46:15.906278Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.906278Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:18920e7b78a0c4c4fde1d56dac19a6346731729179df34c017fbd45e30b3be65","observation_id":"15b2f3a2-c95f-4eb2-b658-4266ccfd58fb","resolution":{"observed_at":"2026-08-14T04:46:15.906278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-14T04:46:15.918373Z","title":"11 Ding, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.918373Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:6820ad962a05c6745f29a9915aa9cb5ef0ca1d842dbcb1c7dc31c9717d78ad32","observation_id":"48c50b2d-4fdf-4c95-b322-8adc64ac5459","resolution":{"observed_at":"2026-08-14T04:46:15.918373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17239","last_updated":"2026-04-23T09:56:57Z","snapshot_observed_at":"2026-08-13T23:36:31.825828Z","submitted_at":"2025-03-21T15:44:09Z","title":"SafeMERGE: Preserving Safety Alignment in Fine-Tuned Large Language Models via Selective Layer-Wise Model Merging","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17239","snapshot_observed_at":"2026-08-14T04:46:15.925093Z","title":"InFindings of the Association for Computational Linguistics (ACL)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.925093Z"},"links":{"cited_paper":"/paper/2503.17239","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:462d75d94f0de7e0f1127a1b975a7530183117de05d3b0a646bd6f3242064486","observation_id":"f9a16946-6a01-4984-8eba-7ea33532729f","resolution":{"observed_at":"2026-08-14T04:46:15.925093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19512","last_updated":"2025-08-28T01:13:45Z","snapshot_observed_at":"2026-08-14T04:53:46.476562Z","submitted_at":"2024-12-27T08:03:22Z","title":"Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19512","snapshot_observed_at":"2026-08-14T04:46:15.928433Z","title":"InFindings of the Association for Computational Linguis- tics (EMNLP), 16589–16602","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.928433Z"},"links":{"cited_paper":"/paper/2412.19512","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:9d93451aa1734a8a172178d46abc51920150c3b5b18b8d4b7aa39f3f59b89b51","observation_id":"263505ab-b217-4b2e-b25a-28d22d546b0b","resolution":{"observed_at":"2026-08-14T04:46:15.928433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07188","last_updated":"2024-07-14T18:27:14Z","snapshot_observed_at":"2026-08-15T03:26:24.732285Z","submitted_at":"2024-06-11T12:01:09Z","title":"Merging Improves Self-Critique Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07188","snapshot_observed_at":"2026-08-14T04:46:15.931694Z","title":"InICML Workshop on Foundation Models in the Wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.931694Z"},"links":{"cited_paper":"/paper/2406.07188","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:4997d60b85d355de9b16d9002082a6082ab4ea2d3faa66144ad4ea1919045fc0","observation_id":"160a6b59-3d94-4591-99d9-e8d9d0612bba","resolution":{"observed_at":"2026-08-14T04:46:15.931694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14563","last_updated":"2024-06-20T17:59:58Z","snapshot_observed_at":"2026-08-14T18:06:18.288974Z","submitted_at":"2024-06-20T17:59:58Z","title":"Model Merging and Safety Alignment: One Bad Model Spoils the Bunch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14563","snapshot_observed_at":"2026-08-14T04:46:15.935356Z","title":"InFindings of the Association for Computational Linguistics (EMNLP), 13033–13046","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.935356Z"},"links":{"cited_paper":"/paper/2406.14563","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:2ecc287208baee73b27422b2dd780114737b6980adec1d97005776ac8037236c","observation_id":"43554abd-4fb4-4256-9cc0-980f1fe26210","resolution":{"observed_at":"2026-08-14T04:46:15.935356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:15.938898Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.938898Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:d0f93a04909bd6d1309aae401e12c850786d9996fec7ddddfeb103bf75108206","observation_id":"5fb6fffd-c50d-49bc-81ba-9498562ad1d6","resolution":{"observed_at":"2026-08-14T04:46:15.938898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-14T04:46:15.941922Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.941922Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:14c677a8f3a5b0ec5a957fb68725fd7461b40b6fc079dd6039f0191a0ada1982","observation_id":"10883db3-9c84-4ec1-bad8-edea276f3489","resolution":{"observed_at":"2026-08-14T04:46:15.941922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16833","last_updated":"2025-01-05T21:51:46Z","snapshot_observed_at":"2026-08-12T23:57:29.577191Z","submitted_at":"2024-05-27T05:04:05Z","title":"Safe LoRA: the Silver Lining of Reducing Safety Risks when Fine-tuning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16833","snapshot_observed_at":"2026-08-14T04:46:15.945333Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.945333Z"},"links":{"cited_paper":"/paper/2405.16833","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:e118620ddacd5252ace867133dca493df354f5d13dac64a52038ecc77e7b4067","observation_id":"8de3ed6b-2a59-4fd7-9736-82895f6c5e3e","resolution":{"observed_at":"2026-08-14T04:46:15.945333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-13T03:27:01.609831Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-14T04:46:15.948851Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.948851Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:50c804a2bddb493f6e32535c832f8bfe3f077fa5cc2a904d3fbed527dee9d3ab","observation_id":"97bca837-2cde-42f6-8e2d-0e43a7d6a0a2","resolution":{"observed_at":"2026-08-14T04:46:15.948851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-14T04:46:15.952662Z","title":"arXiv preprint arXiv:2312.06674","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.952662Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:b7775a0417747f41a69ef3a8a4ffb3397a9cb8e5fd3debd74839167c434f01c2","observation_id":"4d59b9b3-4460-4231-8a1c-bdae26f7acce","resolution":{"observed_at":"2026-08-14T04:46:15.952662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20624","last_updated":"2024-05-22T08:39:46Z","snapshot_observed_at":"2026-08-14T17:06:12.810537Z","submitted_at":"2023-10-31T16:55:06Z","title":"LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20624","snapshot_observed_at":"2026-08-14T04:46:15.956173Z","title":"Li, J.; Zhang, Z.; Zhou, S.; Li, Y.; Yu, T.; and Wang, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.956173Z"},"links":{"cited_paper":"/paper/2310.20624","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:d686f57ed727e74d086ab8657f02422cf75acc0f11d3e7dadfea6107bcc374a4","observation_id":"ed595a6f-298f-4b54-97b1-b072efecf5e5","resolution":{"observed_at":"2026-08-14T04:46:15.956173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.00627","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:16.474590Z","title":"Ma, Q.; Liu, D.; Chen, Q.; Zhang, L.; and Shao, J","venue":null,"work_id":"129bde21-1120-4bfb-b2c0-8102d88f45d8","year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.959717Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:18637b57cc4e7f3c0126804adb01dadbfa771e0fa78b1493d24e8713f8fc4c5d","observation_id":"f062de73-6dba-4e4b-b2f7-661c6350bfc7","resolution":{"observed_at":"2026-08-14T04:46:16.480680Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16770","last_updated":"2025-08-14T07:15:21Z","snapshot_observed_at":"2026-08-07T17:54:34.208761Z","submitted_at":"2025-02-24T01:19:43Z","title":"LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16770","snapshot_observed_at":"2026-08-14T04:46:15.963181Z","title":"InAnnual Meeting of the Association for Computational Linguistics (ACL), 21749–21767","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.963181Z"},"links":{"cited_paper":"/paper/2502.16770","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:d954b19b86c789c779a7cf88d29166381bbc97af3cfe8cf8da93a3e9f51749ef","observation_id":"34fe08dc-c22f-40d1-b7a6-97b24bf6ac3d","resolution":{"observed_at":"2026-08-14T04:46:15.963181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-14T04:46:15.966829Z","title":"InInternational Conference on Machine Learning (ICML), 35181–35224","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.966829Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:7153b909a26defe2f0ab8dfc13e2071bdfc6d9d8dbd28fe1de2c02b69a379e9d","observation_id":"86e8fea2-8046-4f65-b74d-eb2de5219de0","resolution":{"observed_at":"2026-08-14T04:46:15.966829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-12T23:46:49.092229Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-14T04:46:15.970418Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.970418Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:712b96adee9040042a0cbebbe7e711a605d9eec3d428f2219c3b15a7cfcec4d5","observation_id":"b5a8c56f-75eb-4375-ae08-1c6007877dbb","resolution":{"observed_at":"2026-08-14T04:46:15.970418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-14T04:46:15.973885Z","title":"ArXiv:2310.03693","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.973885Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:cba4a2c3a7839b2d45495d34f744c2b752e1ced30415a9ea0be08c1921b7ff58","observation_id":"6326a994-2fc5-488f-ba26-9a40adc8c0bb","resolution":{"observed_at":"2026-08-14T04:46:15.973885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-13T05:33:18.631487Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01833","snapshot_observed_at":"2026-08-14T04:46:15.978011Z","title":"InUSENIX Security Symposium, 2421–2440","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.978011Z"},"links":{"cited_paper":"/paper/2404.01833","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:7e17929278f45ab943d3242c4bb71e668df3d322b922536902274cb761200de6","observation_id":"661d7a26-7acf-4570-b022-dc295f2eff51","resolution":{"observed_at":"2026-08-14T04:46:15.978011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:15.981197Z","title":"Thakkar, M.; Fournier, Q.; Riemer, M.; Chen, P.-Y.; Zouaq, A.; Das, P.; and Chandar, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.981197Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:f314ee816fbcac736bd32d0270de2a91af67caaed726b372bd86866ecef4e249","observation_id":"e620d36b-1e62-46d8-af9a-40cd00a1cf4b","resolution":{"observed_at":"2026-08-14T04:46:15.981197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06824","last_updated":"2025-05-30T17:17:04Z","snapshot_observed_at":"2026-08-12T22:03:33.042500Z","submitted_at":"2024-11-11T09:32:20Z","title":"Combining Domain and Alignment Vectors to Achieve Better Knowledge-Safety Trade-offs in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06824","snapshot_observed_at":"2026-08-14T04:46:15.984176Z","title":"InAnnual Meeting of the Association for Computational Linguistics (ACL), Short Papers, 268–277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.984176Z"},"links":{"cited_paper":"/paper/2411.06824","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:ac936e851b6377dbde36451c976d88209ab9af2746304a5c40c377425fe25204","observation_id":"0aed9cd0-699d-49f4-a2b1-3cbe23fd347a","resolution":{"observed_at":"2026-08-14T04:46:15.984176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05162","last_updated":"2024-10-24T19:21:52Z","snapshot_observed_at":"2026-08-13T04:24:02.200648Z","submitted_at":"2024-02-07T18:34:38Z","title":"Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05162","snapshot_observed_at":"2026-08-14T04:46:15.991367Z","title":"InInternational Conference on Machine Learning (ICML), 52588–52610","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.991367Z"},"links":{"cited_paper":"/paper/2402.05162","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:911b80988f38ef234fa3b8c3ed107defcaa971cd12044c90b9a173c791b77696","observation_id":"df4dee33-b099-436b-821c-ee82e644ba1c","resolution":{"observed_at":"2026-08-14T04:46:15.991367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09880","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:16.276574Z","title":"InIEEE Symposium on Security and Privacy (S&P)","venue":null,"work_id":"10cec7ed-9357-4360-a74b-0108c0ee2344","year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.998855Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:751fa7dda075bac2716edc09339034918eb03685b2c6d77760fde9f1715b744a","observation_id":"a0068464-d3d9-4cf4-9eef-4d141eb2f968","resolution":{"observed_at":"2026-08-14T04:46:16.282205Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09324","last_updated":"2024-11-06T04:43:57Z","snapshot_observed_at":"2026-08-12T23:43:22.765242Z","submitted_at":"2024-06-13T17:01:40Z","title":"Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09324","snapshot_observed_at":"2026-08-14T04:46:16.001976Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.001976Z"},"links":{"cited_paper":"/paper/2406.09324","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:8dea92883c943f722aaccf808bd3ea6cc384ed55f66cb66ec6214948fe96a6b4","observation_id":"e8a0e393-1d01-47bf-9d95-30e914561159","resolution":{"observed_at":"2026-08-14T04:46:16.001976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-13T15:23:54.677158Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-14T04:46:16.005471Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.005471Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:2daec7e072b1decb8e44ae6771d7e10ae23477853c2225ab96548ee33b38d607","observation_id":"48faf8a9-8c10-4345-8027-8a2ed3018bd4","resolution":{"observed_at":"2026-08-14T04:46:16.005471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13910","last_updated":"2025-02-27T17:08:19Z","snapshot_observed_at":"2026-08-12T22:21:25.584890Z","submitted_at":"2024-10-17T00:13:31Z","title":"Mitigating the Backdoor Effect for Multi-Task Model Merging via Safety-Aware Subspace","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13910","snapshot_observed_at":"2026-08-14T04:46:16.009315Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.009315Z"},"links":{"cited_paper":"/paper/2410.13910","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:e055eb6c1b5105d1dfc280d0f281df8ab0533f5f18af2af212d3a4aa24e0d362","observation_id":"cc05a525-f187-4a51-91da-fc87494fd375","resolution":{"observed_at":"2026-08-14T04:46:16.009315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03099","last_updated":"2024-06-13T11:56:04Z","snapshot_observed_at":"2026-08-14T02:57:28.643013Z","submitted_at":"2023-11-06T13:43:07Z","title":"Language Models are Super Mario: Absorbing Abilities from Homologous Models as a Free Lunch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03099","snapshot_observed_at":"2026-08-14T04:46:16.012609Z","title":"InInternational Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.012609Z"},"links":{"cited_paper":"/paper/2311.03099","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:952e01652681f1d3e9625b8fa40ac172629fded8f332b0a247b802022728e1c5","observation_id":"295ba9dd-4fd7-4a7e-b69e-5d522a441f8d","resolution":{"observed_at":"2026-08-14T04:46:16.012609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:16.015991Z","title":"13 Zhang, J.; He, Y.; Cai, K.; Zhao, H.; Suya, F.; and Tian, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.015991Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:7b2f751127f2a6d36ff2e72bc21a7bd54f2227095041896ca242c7db45c806a6","observation_id":"1ac8c5ef-3832-406b-b9f0-0167555c2ab6","resolution":{"observed_at":"2026-08-14T04:46:16.015991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03344","last_updated":"2026-06-02T08:54:37Z","snapshot_observed_at":"2026-08-14T08:59:39.927417Z","submitted_at":"2026-06-02T08:54:37Z","title":"RogueMerge: Robust and Unified Attacks against LLM Model Merging","version":1},"cited_work":{"arxiv_id":"2606.03344","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03344","snapshot_observed_at":"2026-08-14T04:46:16.078594Z","title":"RogueMerge: Robust and Unified Attacks against LLM Model Merging","venue":"cs.CR","work_id":"1e1b84e2-4a7c-4ef7-81d2-4ba1745ecb5e","year":2026},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.019854Z"},"links":{"cited_paper":"/paper/2606.03344","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:59ec3191676ff42c430fe335cbdef6433617bc2b4e1572aa7f8b33aa1c747ebb","observation_id":"816b8940-0521-4aa9-8f69-e4b1d337326e","resolution":{"observed_at":"2026-08-14T04:46:16.084279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-14T04:46:16.024015Z","title":"Zou, A.; Wang, Z.; Carlini, N.; Nasr, M.; Kolter, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.024015Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:6b2b8145a082b441ba5fb4b2663aba5bf50db7953d4a58fad4c518bb61d01a3d","observation_id":"98f5e297-da19-442b-ad61-891ff6f9b58f","resolution":{"observed_at":"2026-08-14T04:46:16.024015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-14T04:46:16.027663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:16.027663Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:db75878976ff7db0c165cee3aa743cef4cfd177551a935a0ea897c238ae75569","observation_id":"6c633179-6ea7-4e8f-95ce-bdbd5f951d6a","resolution":{"observed_at":"2026-08-14T04:46:16.027663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08347","last_updated":"2020-10-23T12:07:41Z","snapshot_observed_at":"2026-08-10T22:14:27.457241Z","submitted_at":"2020-02-19T18:50:29Z","title":"On Adaptive Attacks to Adversarial Example Defenses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08347","snapshot_observed_at":"2026-08-14T04:46:15.987575Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.987575Z"},"links":{"cited_paper":"/paper/2002.08347","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:ccf580ae6ae4c34777acd871db2d623e2ac6ef192fce1500c8d991ff938473d1","observation_id":"b5977ead-c045-42d7-8b35-919c91173192","resolution":{"observed_at":"2026-08-14T04:46:15.987575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-14T04:46:15.914300Z","title":"Cobbe, K.; Kosaraju, V.; Bavarian, M.; Chen, M.; Jun, H.; Kaiser, L.; Plappert, M.; Tworek, J.; Hilton, J.; Nakano, R.; Hesse, C.; and Schulman, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.914300Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:b2f23754e8312964380f634c1f0890417dca8b8a4ffa64b441fb61f1ce073622","observation_id":"c5912dd9-fde1-4e9a-ae1b-df767c20100c","resolution":{"observed_at":"2026-08-14T04:46:15.914300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05482","last_updated":"2022-07-01T23:48:19Z","snapshot_observed_at":"2026-08-13T16:25:25.521746Z","submitted_at":"2022-03-10T17:03:49Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05482","snapshot_observed_at":"2026-08-14T04:46:15.995296Z","title":"InInternational Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.995296Z"},"links":{"cited_paper":"/paper/2203.05482","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:a376be0d18977bc457bfe5a5e358b7fe99058b34680ab49940fbe4d2840b9d66","observation_id":"18a463a7-77b2-4c50-ba3f-5b93303b948c","resolution":{"observed_at":"2026-08-14T04:46:15.995296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-12T12:29:45.113982Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-14T04:46:15.910426Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.910426Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:f8f6702300041d7b27b1059cff102f947ec2eecf8da07dd61bde8889cf95182f","observation_id":"47639529-db75-489e-bd56-2232d42798dc","resolution":{"observed_at":"2026-08-14T04:46:15.910426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11717","last_updated":"2024-10-30T18:57:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T16:36:12Z","title":"Refusal in Language Models Is Mediated by a Single Direction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11717","snapshot_observed_at":"2026-08-14T04:46:15.897691Z","title":"InAdvances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.897691Z"},"links":{"cited_paper":"/paper/2406.11717","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:cdfaedc7a9d5978ca0469ceb300cd88381074b1a294c8cfd9d6c25aa28801d6e","observation_id":"d44097e4-6445-4aeb-bbc8-f3be439fbf4f","resolution":{"observed_at":"2026-08-14T04:46:15.897691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-13T00:39:04.444350Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-14T04:46:15.893135Z","title":"InInternational Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.893135Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:66a68ee04b14387481d9d25e92094c94faeb9dde35efec7449f3b6cd4af7b08e","observation_id":"51554e35-6a93-4cf9-9a88-4642ef2b828a","resolution":{"observed_at":"2026-08-14T04:46:15.893135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:46:15.922065Z","title":"Djuhera, A.; Kadhe, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:46:15.922065Z"},"links":{"citing_paper":"/paper/2608.08542"},"observation_digest":"sha256:5ba273e5b35b2343fd84f4afe27e8db2dcdbd457fc766c22628c9c44109b7356","observation_id":"22524470-4f0d-4b99-b3eb-a6973346ebee","resolution":{"observed_at":"2026-08-14T04:46:15.922065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08542","last_updated":"2026-08-09T07:41:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T08:59:47.451043Z","submitted_at":"2026-08-09T07:41:06Z","title":"When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.08542."}