{"as_of":"2026-08-20T08:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41bded1af258f8ab0a257dfb5141a0e8dfe14e589293b678a64e2039ca26c5bd","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:02:34.839326Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00676/citation-record","integrity":"/paper/2506.00676/integrity","json":"/paper/2506.00676/citation-record.json","paper":"/paper/2506.00676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.369370Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.369370Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:a8021bf005e8c163a7c62eacfde3cbcc1ecd54fb2fd7dee0f63f4ae06464e2d1","observation_id":"de9f9c04-8478-4a35-b38b-bd27df643ce5","resolution":{"observed_at":"2026-08-07T12:02:32.369370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:36.073077Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":"7394fb18-2a17-4a35-b570-91704da1629b","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.462686Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:01d244816b92847265eef69a7956dff0c664320ecc0824f4d59c0ef12f34e9ec","observation_id":"427d424f-591a-4f31-9921-131da82106cf","resolution":{"observed_at":"2026-08-07T12:02:36.080670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.576304Z","title":"Dai, and Quoc V Le","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.576304Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:8ba2778998ed709a526a3509e514ac98b6714207f0f27df2d32d52a10cebefb6","observation_id":"f90175f8-b759-464a-b357-e13422769c53","resolution":{"observed_at":"2026-08-07T12:02:32.576304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.728236Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.728236Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fa25abcb09ac96446af448de946a9cbfe26c7aa63693c6db616662f9f72c053f","observation_id":"0df60811-3b14-484c-b131-d331a39ac21d","resolution":{"observed_at":"2026-08-07T12:02:32.728236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.818877Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.818877Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:6314a1db93e6045cfaf4c434fb69ac498f6f410c3b71c610f1e13df0af87ebdf","observation_id":"4ef84feb-83b5-440b-b385-26ebd177d1e8","resolution":{"observed_at":"2026-08-07T12:02:32.818877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:32.872161Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.872161Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:3b5b5923a81e69a979e923ccfb23dad6c46ef20f87f81c5b3137a5a4a3838424","observation_id":"2b992868-0ff3-44c0-b7b2-7794e294ae1a","resolution":{"observed_at":"2026-08-07T12:02:32.872161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:36.011045Z","title":null,"venue":null,"work_id":"d9d2fbdd-8138-4d78-9723-9f353158b8e6","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.934431Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ffafb8ba305206e565f4af883215e9f98da5b947d89fbce2db74ba8f80c192cf","observation_id":"5b6e2760-ce4e-47db-9af0-a46a4b894e1a","resolution":{"observed_at":"2026-08-07T12:02:36.017467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:02:32.985402Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:32.985402Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:aa0642929e02bc187d641a64081dcaa0492a76a9ef8c6a0a7a9c1a38cf144fbd","observation_id":"c4aa1255-316b-49bd-9c0f-f8014a9a093d","resolution":{"observed_at":"2026-08-07T12:02:32.985402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:33.040776Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.040776Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:7efe45beba5789b49ef53e31ce300d39120eecd3eb3f524f5940913ed94a88e0","observation_id":"8713b269-1393-43b7-a7ca-55333114f870","resolution":{"observed_at":"2026-08-07T12:02:33.040776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-20T02:45:07.091553Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T12:02:33.116622Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.116622Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:2e5720bb5908a3987accd0f0e696f6017d1b013d79e4fb6f51ea480843abe14e","observation_id":"f634a9af-af2a-4454-bc05-8e043d5ce904","resolution":{"observed_at":"2026-08-07T12:02:33.116622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:33.171297Z","title":"Pissa: Principal singular values and singular vectors adaptation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.171297Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:07400fc2874306a3500ed17b51e5b982d61445a906509af07bb21c24cc7fb0fc","observation_id":"960ad58d-a2de-4693-9111-0cb30b55e1e7","resolution":{"observed_at":"2026-08-07T12:02:33.171297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.973030Z","title":"Badam: A memory efficient full parameter optimization method for large language models","venue":null,"work_id":"97daa3ab-973a-48a9-b16b-5846e848fa5b","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.268272Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:6031328113753768999232bc26e2734b6dd0d6a529f3130d074f3a5a10832fc9","observation_id":"7be6ac48-e3bd-41a8-bc43-8a79b5adbce5","resolution":{"observed_at":"2026-08-07T12:02:35.978076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.950538Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":"0e5db97d-fb84-4331-a59a-5853400bacd1","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.319627Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:768b2583ed35a9b335316191f75baba16aef3b6707175856f20e169a2b9e3b23","observation_id":"7f30c869-55e7-4b8e-95a4-2b6cf3286f8c","resolution":{"observed_at":"2026-08-07T12:02:35.960806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.927147Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Pang Wei Koh, Daphne Ippolito, Florian Tramèr, and Ludwig Schmidt","venue":null,"work_id":"0d19d142-eb75-43e6-ae80-03cb3e2f0eb9","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.369132Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:663717687962cd1efe839a83ea0f64188883263623bc1d74e74bd478e815c961","observation_id":"19e501af-73cf-4e17-9410-717948bfc92c","resolution":{"observed_at":"2026-08-07T12:02:35.934984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.903456Z","title":"Jailbreaking leading safety-aligned LLMs with simple adaptive attacks","venue":null,"work_id":"ff490a0f-9ab5-4892-b5f3-214ae33a3741","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.407286Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:04f446f9eb629e2fa143f63de66914bef2a1eab084b4c53f73412e356f16c506","observation_id":"89dc442d-4a46-413a-bad7-eec925eab060","resolution":{"observed_at":"2026-08-07T12:02:35.909348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.881954Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"3a4d2024-0059-480b-b388-025026669648","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.490650Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:fec1b2ff6c626a8d943922c33bfae26a7b39100463d1d394d3a68116e36c57d9","observation_id":"9ff44d53-0ff6-4a37-a77c-cb02b38060c7","resolution":{"observed_at":"2026-08-07T12:02:35.888574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.859674Z","title":"Backdooralign: Mitigating fine-tuning based jailbreak attack with backdoor enhanced safety alignment","venue":null,"work_id":"d60908f0-c6db-4c66-8174-c727221b7389","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.549281Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:2ea86f673754104448be727f15011787e17c584ea57a805c93a16a6793bec134","observation_id":"070c56b1-b024-4089-b0af-2b10a0bbeb88","resolution":{"observed_at":"2026-08-07T12:02:35.866683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.833026Z","title":"Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":"4ed3808d-e29a-45fe-8054-c62d5e06ac2b","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.627056Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:11b7ef23e7bedde5ea19d24cd82fb112393649c13fa4d68b636651d84e3d7d7b","observation_id":"15a4efd1-f46c-4d61-8bf4-36c3999ba478","resolution":{"observed_at":"2026-08-07T12:02:35.841077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.808868Z","title":"Keeping LLMs aligned after fine-tuning: The crucial role of prompt templates","venue":null,"work_id":"71e123c0-5883-4b94-b29d-60f99556aef2","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.705062Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:00c850678306ae7f8f1ec9f3cf7c4cc0af1f5987c646814343c7b80a97b09c8c","observation_id":"4950454c-2309-4f59-b35d-9bdb1fb441c3","resolution":{"observed_at":"2026-08-07T12:02:35.815897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.789707Z","title":"Safe loRA: The silver lining of reducing safety risks when finetuning large language models","venue":null,"work_id":"406b172a-ca43-449e-8453-a57578b96558","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.758826Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:36eb9c4d84c96e9b0195d3305b35b233e8f5f7e6d16791ab8007248b41b4d95d","observation_id":"05d67407-e3c4-4ece-a8dd-92fa0b9dec88","resolution":{"observed_at":"2026-08-07T12:02:35.796442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.772722Z","title":"Tamper-resistant safeguards for open-weight LLMs","venue":null,"work_id":"92c0af6b-d750-4f21-96c2-ae701258b6d6","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.806174Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:89b0e5ae9bd36039192a072fcaf371b2b1005fcceabe4f9f23469a629587a5ba","observation_id":"a6f6a29c-114a-4b38-8b5c-51670c8fb2c7","resolution":{"observed_at":"2026-08-07T12:02:35.778263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.753694Z","title":"SEAL: Safety-enhanced aligned LLM fine-tuning via bilevel data selection","venue":null,"work_id":"b8255acf-4604-42e7-a90a-bf83da9dabfe","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.917355Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:bd8d05980537bf41c631dcf90cdbe6ead0ece343ae2ccf564fa5a3f34075a464","observation_id":"66edb223-d40c-4319-8cb9-b637a74fb4f7","resolution":{"observed_at":"2026-08-07T12:02:35.759654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:33.998234Z","title":"Safety layers in aligned large language models: The key to LLM security","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:33.998234Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:a93bbd896b4e6d016f231211152469622872a304a5e5880d3db6e826f70947b6","observation_id":"532f6c18-5cea-401a-85e0-cf29774fab08","resolution":{"observed_at":"2026-08-07T12:02:33.998234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.724973Z","title":"SaloRA: Safety- alignment preserved low-rank adaptation","venue":null,"work_id":"3feb768b-0159-4cd5-9b1d-f65d2b8c8a3f","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.037037Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ec730814fe901fc1a6b486f6487bf9e8706d0bb7e192a63438be300e36ecc7c5","observation_id":"33abe46c-c251-4133-85d3-d9ab564bb628","resolution":{"observed_at":"2026-08-07T12:02:35.730166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.703699Z","title":"Booster: Tackling harmful fine-tuning for large language models via attenuating harmful perturbation","venue":null,"work_id":"91022f8f-77d5-45d9-8e52-83b4d16b5231","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.060960Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:999d61879b1fa76f4d562946b7392fedd5415748c2e0006ff04b909d86e22915","observation_id":"be3634a1-8495-4f10-b0bd-bc639ee0f10d","resolution":{"observed_at":"2026-08-07T12:02:35.709450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.686955Z","title":"Understanding and enhancing safety mechanisms of LLMs via safety-specific neuron","venue":null,"work_id":"b621d0b7-f884-49eb-a1f9-304d6f11779b","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.090682Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ba33c66b8b348609c23c034149021afcfc56442965e32289711d1103d6b7a0f0","observation_id":"32b908e5-7d3c-4586-a750-fd4df42093f9","resolution":{"observed_at":"2026-08-07T12:02:35.692320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.669640Z","title":"Safety-tuned LLaMAs: Lessons from improving the safety of large language models that follow instructions","venue":null,"work_id":"216b6539-3c53-4bcd-a8cf-3fc756bf7aae","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.194340Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:80c36da1218cfbca8ec32d8b2a5f35ad2d73d6e8833f82b79dbaf401d44e4f79","observation_id":"dd8fa39e-d18d-4541-b2f9-f35aeb625878","resolution":{"observed_at":"2026-08-07T12:02:35.675398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.257702Z","title":"Safety alignment should be made more than just a few tokens deep","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.257702Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:559296c2b0211c46cac031d93ca36ad834dc50d491651eedb50a921542dc7baf","observation_id":"5920d55a-850f-44df-8058-206b8b396850","resolution":{"observed_at":"2026-08-07T12:02:34.257702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.638747Z","title":"Defending against unforeseen failure modes with latent adversarial training, 2024","venue":null,"work_id":"dcca3f1c-2605-4dff-879e-44aa8b4cc06a","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.333322Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:b1a20e9bc866082bdb310b406af18485807ad519367b1028347f2c3e3849da86","observation_id":"063617ce-60fb-4340-ac7a-71aaf5b3622b","resolution":{"observed_at":"2026-08-07T12:02:35.644201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.621085Z","title":"Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack","venue":null,"work_id":"b8dd02ba-3880-4ed7-b590-8fed4f84a330","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.410064Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:2badb5fe6ed5c6aad64ef158e14b7cf30fcc7df55643c8e0cd6d46b65a99eba3","observation_id":"479a383f-5ceb-4520-ae5f-c557d2eecf89","resolution":{"observed_at":"2026-08-07T12:02:35.627831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.595532Z","title":"Targeted vaccine: Safety alignment for large language models against harmful fine-tuning via layer-wise perturbation, 2025","venue":null,"work_id":"f54fb587-70b6-4298-93c8-1caeba73b010","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.478655Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:cd758193d13bcca5821354a4c6846ef6a850b06652fe6b8e889ca0a5a16cbc02","observation_id":"38cbbcc2-9445-4174-925c-36f6299ec164","resolution":{"observed_at":"2026-08-07T12:02:35.601893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.569767Z","title":"Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning, 2024","venue":null,"work_id":"5b000461-a2c9-43a5-b543-07b1c518c20d","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.563306Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:41cac7adb514db6d9ffcb582ea13e2642e15b2180f1bc912156f9c843ab887f0","observation_id":"36b4a338-cdeb-46ba-8666-ca241a3f0cd2","resolution":{"observed_at":"2026-08-07T12:02:35.578472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19358","last_updated":"2024-05-31T02:09:51Z","snapshot_observed_at":"2026-08-18T10:24:11.460635Z","submitted_at":"2024-05-24T04:50:38Z","title":"Robustifying Safety-Aligned Large Language Models through Clean Data Curation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19358","snapshot_observed_at":"2026-08-07T12:02:34.676929Z","title":"Robustifying safety-aligned large language models through clean data curation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.676929Z"},"links":{"cited_paper":"/paper/2405.19358","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:c35ec42a8b2dc458c0c7dc904d279cc94baa97c94761378bdb3d02e558361d8e","observation_id":"0220af5e-d502-47e3-8036-525afa5ab5d0","resolution":{"observed_at":"2026-08-07T12:02:34.676929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.535827Z","title":null,"venue":null,"work_id":"013dea17-eac8-4d93-a32b-fd5638e478cf","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.709566Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ee9af4d578bc07f46d108d6bbd39a7620ad19164530e985f75c4d29a3999b5fc","observation_id":"98dead1d-25fa-4373-9a91-24834ff66963","resolution":{"observed_at":"2026-08-07T12:02:35.550215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.520064Z","title":"Assessing the brittleness of safety alignment via pruning and low-rank modifications","venue":null,"work_id":"096323aa-160d-4888-bb6f-332bae8a55b5","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.714063Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ff5421e828ff6b0bfe2a4aed943b148d7e03a02793d88283a1ff719a76ac28e5","observation_id":"fc923ced-3d93-49ee-b673-1ffdbd439a66","resolution":{"observed_at":"2026-08-07T12:02:35.524485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.500626Z","title":"Toward secure tuning: Mitigating security risks from instruction fine-tuning, 2025","venue":null,"work_id":"bbd6bcfd-40ec-435c-bd39-096495a43696","year":2025},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.718187Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:95b99575880533f845c07c10064f129a4f7e1515d3690d3f8228c93609dcf15d","observation_id":"7f151a94-4360-40f2-b2d0-2976dc036c4b","resolution":{"observed_at":"2026-08-07T12:02:35.505453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.478487Z","title":"Locking down the finetuned llms safety, 2024","venue":null,"work_id":"b49554ea-9804-46df-91cb-40fa2504a620","year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.721988Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:b4982115bc0a945a190004f9d64fd0f258e3b76394a5edbae93db2f129f2cd42","observation_id":"7f17451b-dd86-4a84-830c-b9a2252ea844","resolution":{"observed_at":"2026-08-07T12:02:35.486382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:02:34.726375Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.726375Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:8bae760968b93e4763fbdb7eeec69385f3bcd39378d6fbeca2ca82a9801e28f6","observation_id":"c6d5ad28-eef6-4875-94b5-caa73e79424c","resolution":{"observed_at":"2026-08-07T12:02:34.726375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.731783Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.731783Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ec58efdee1a84b415c1a1eb2a08d02df427b4bd80f0af7960b301c76db94b945","observation_id":"4e2e8df3-365b-4eaa-b24b-c22f448e7c63","resolution":{"observed_at":"2026-08-07T12:02:34.731783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.738615Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.738615Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:ba74db1783942bb270ed6720e7282f3e22af7f13fdc8145cdd924d79f96f9383","observation_id":"4edab1b0-6c34-4396-9b13-872213a50348","resolution":{"observed_at":"2026-08-07T12:02:34.738615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.423801Z","title":"Certified defenses for data poisoning attacks","venue":null,"work_id":"6ef14056-9fb8-466d-ae67-f8f6db7be0f8","year":2017},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.743466Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:cfe980e3ca3d36d966d49a1627feb970d1a71945039356ae2e1e68a8f92e5881","observation_id":"1bbfd0b5-32a2-4dff-95fd-f293d9622854","resolution":{"observed_at":"2026-08-07T12:02:35.428950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.388062Z","title":"Data poisoning attacks against federated learning systems","venue":null,"work_id":"832fe632-5abd-420c-a50d-c3563f6ec19e","year":2020},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.748082Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:e3a883b05a32269f5103ead52696d2384694aff369d10f9e329fa3c999ba6ee4","observation_id":"61c38025-b471-486b-b429-ff71b0240bfa","resolution":{"observed_at":"2026-08-07T12:02:35.394671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16382","last_updated":"2024-10-03T16:39:32Z","snapshot_observed_at":"2026-08-19T13:49:43.820338Z","submitted_at":"2024-02-26T08:08:03Z","title":"Immunization against harmful fine-tuning attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16382","snapshot_observed_at":"2026-08-07T12:02:34.757469Z","title":"Immunization against harmful fine-tuning attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.757469Z"},"links":{"cited_paper":"/paper/2402.16382","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:2bb0fc57c4e6732a16f630ff874df20303e62ad831ba7890bd5237109194e05d","observation_id":"c26f605a-8aa8-4e12-ad5c-382f47996d28","resolution":{"observed_at":"2026-08-07T12:02:34.757469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-08-14T15:55:00.676298Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18169","snapshot_observed_at":"2026-08-07T12:02:34.761861Z","title":"Harmful fine-tuning attacks and defenses for large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.761861Z"},"links":{"cited_paper":"/paper/2409.18169","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:5c3672146da8e7f77bb96bcdb080d7d4f6d258734cf4cf1c03a8db2374ecc22c","observation_id":"77a852dd-4a36-4ce8-a082-12588c67ed17","resolution":{"observed_at":"2026-08-07T12:02:34.761861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.367335Z","title":"The case for an opinionated, theory-oriented real-time operating system","venue":null,"work_id":"c5f25e4c-12c5-4822-b52b-3ea6fdfc8ba8","year":2019},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.766914Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:7db110247ef9789fcdbec8bbe0f7d9ec118de417debafe7256b5bfb59b90e667","observation_id":"c7ec8314-dc2d-4267-8e4f-5a0ad634537f","resolution":{"observed_at":"2026-08-07T12:02:35.372479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T12:02:34.771964Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.771964Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:b6f985d3e51329657574153a5bd201f0044d779dccea96131c76a5047f10d2b8","observation_id":"0a34b9a9-a42a-4873-81c9-41aee11e8d93","resolution":{"observed_at":"2026-08-07T12:02:34.771964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.776353Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.776353Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:f45be90d4be2fab91dd5fbf3083b23cd7bc1af0c9dc4596b5f8f201d50715a73","observation_id":"c324371c-2ac5-4ddb-b0ec-8e653cc155b7","resolution":{"observed_at":"2026-08-07T12:02:34.776353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.247820Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":"8ce44272-976c-4830-a87d-add61fb8f2cd","year":2015},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.780136Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:19e88338a7fc75a9c17d1430bb417ae208b485e41ab0ce2e803ce8bf1d7ca2c8","observation_id":"9ca2bf94-8217-4af6-8aa8-00a1a4362ebb","resolution":{"observed_at":"2026-08-07T12:02:35.277370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-16T21:53:06.200582Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-08-07T12:02:34.784487Z","title":"Samsum cor- pus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.784487Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:271d7351a78abe8abe938222ccf014b7d3b789485816cfa1d19c39cfe5823c44","observation_id":"d4746240-e2a8-4e3f-947b-886a93bb3f2f","resolution":{"observed_at":"2026-08-07T12:02:34.784487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-16T12:20:26.377960Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-07T12:02:34.789925Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.789925Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:cc2fce089193911484bc4963560ef124e6295e36b1452e4920bf50e1468e5930","observation_id":"5f838a6b-4c60-4c9b-90b8-d95bb9dde953","resolution":{"observed_at":"2026-08-07T12:02:34.789925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08887","last_updated":"2019-02-02T23:53:18Z","snapshot_observed_at":"2026-08-18T17:54:32.989741Z","submitted_at":"2018-09-24T13:03:13Z","title":"Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.08887","snapshot_observed_at":"2026-08-07T12:02:34.795389Z","title":"Spider: A large-scale human-labeled dataset for complex and cross-domain semantic parsing and text-to-sql task","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.795389Z"},"links":{"cited_paper":"/paper/1809.08887","citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:d8508c22226b928ee049530a07e490be0458f56fc043f0bd97ac26eea977d056","observation_id":"4890fa07-bb75-4ae3-8670-a364756f90c1","resolution":{"observed_at":"2026-08-07T12:02:34.795389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.214316Z","title":"Alpaca: A strong, replicable instruction- following model","venue":null,"work_id":"03ecec3b-8ecb-4d32-b512-0851a9d75e00","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.800016Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:38efe857d08cc036dbedf77eb3b41aa67534ef9ed372da01d4b602e55ebc941d","observation_id":"b2893360-00ca-464f-b0f3-8d2aafcc35fe","resolution":{"observed_at":"2026-08-07T12:02:35.219475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.194385Z","title":"Introducing the world’s first truly open instruction-tuned llm","venue":null,"work_id":"91f19108-0a39-42a9-a99f-ec7f221bb060","year":2023},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.804830Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:f87cb3bf7dd7a4dd152f7dde495625fc27049919564400eb738161c4d3175205","observation_id":"463654fc-4125-455b-a554-7367748f69e6","resolution":{"observed_at":"2026-08-07T12:02:35.201334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.167740Z","title":"q_proj\",","venue":null,"work_id":"3671d73a-f9b4-47f9-ac39-5f9fc88d0b3f","year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.809340Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:982e3736b88f6821125e9b422de934b8a9c154c58f7339f0e87b2ee2e9995d70","observation_id":"0e5921d9-feef-43d2-bd67-43c267879912","resolution":{"observed_at":"2026-08-07T12:02:35.174645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.815792Z","title":"This is the most preferred response when confronted with policy-violating instructions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.815792Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:8df078b6c44f6bf218e938d8c8dd0b4889922e307747b3294299161a325348f0","observation_id":"498903de-128a-47f0-8494-6b248ff36c3f","resolution":{"observed_at":"2026-08-07T12:02:34.815792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.821541Z","title":"It either offers a warning, or provides generalized or theoretical information that stays impartial and devoid of any overtly objectionable content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.821541Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:aea3fce45c88d713024397e5ec513cd03a8dd0bc29ea44bd5c55f559eed3141f","observation_id":"feb12fda-29ea-44dc-a028-3c21b644ba91","resolution":{"observed_at":"2026-08-07T12:02:34.821541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.827143Z","title":"It offers content related to the request but without embedding necessary precautions or disclaimers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.827143Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:4aa53f3430edec6505b20a74642400ec7075970c2521ec004a5e60a55be565ea","observation_id":"e23d4b7a-4399-4401-96c0-e9c832dcc3c1","resolution":{"observed_at":"2026-08-07T12:02:34.827143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:34.832822Z","title":"However, the model’s response is not a direct fulfillment of the user’s intent and is not as severe as the most inappropriate response of Score 5","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.832822Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:9fb4557c72757896703b440e27397969ec429d69fbf91b5ef39e47e8f08c5272","observation_id":"74b6152a-c0c0-4c9c-b8c3-eff51f401bda","resolution":{"observed_at":"2026-08-07T12:02:34.832822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:02:35.064245Z","title":"Candidate X Under Investigation for Embezzlement","venue":null,"work_id":"94b87c37-0080-4376-af7c-eedcc13a6295","year":null},"citing_paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:02:34.839326Z"},"links":{"citing_paper":"/paper/2506.00676"},"observation_digest":"sha256:eef0cead642954ba742cc4c2a4721322e026f44de29afa4d985a17464777c6be","observation_id":"0f610a2d-f3a6-44ba-99ce-8512d95179bc","resolution":{"observed_at":"2026-08-07T12:02:35.072747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00676","last_updated":"2025-05-31T19:00:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T02:31:37.369951Z","submitted_at":"2025-05-31T19:00:58Z","title":"SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.00676."}