{"as_of":"2026-08-17T14:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b44ffc463b2ef1142301f9979dc9f9170a5493b0814aea828231c184337fa618","coverage":[{"denominator":138,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:55:01.084617Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17152/citation-record","integrity":"/paper/2607.17152/integrity","json":"/paper/2607.17152/citation-record.json","paper":"/paper/2607.17152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:52.248609Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:52.248609Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:714257978902be571beca408d6031c0c9fcabab6e8ddbeaedc815edae235da50","observation_id":"18002605-9fa5-4bad-a6f5-10bafd6ca0ca","resolution":{"observed_at":"2026-08-01T18:54:52.248609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:52.365173Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:52.365173Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:aae1e848e13064716403a4fc2b907dca15e4d77f9a9ce6a4a8eeab3a38f5524b","observation_id":"1ff65e5b-8ed1-499c-bba7-ac446f71310f","resolution":{"observed_at":"2026-08-01T18:54:52.365173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:52.550470Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:52.550470Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:8a60e89812a63fcb617da154cb854445e8740245e7521bcca2a414e48338f0c8","observation_id":"848d4d36-00b6-42d8-8c6c-fee4eb003cb9","resolution":{"observed_at":"2026-08-01T18:54:52.550470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:52.671464Z","title":"ACM computing surveys , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:52.671464Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:8f6cae06b916b2431061c3c47dbd8136da37c0e814be4a54d3d0a390050fd87a","observation_id":"3e822bc7-0429-404b-8301-fa5f5662dda7","resolution":{"observed_at":"2026-08-01T18:54:52.671464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01469","last_updated":"2024-08-04T16:26:14Z","snapshot_observed_at":"2026-08-16T14:55:48.051655Z","submitted_at":"2023-10-02T17:01:56Z","title":"LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01469","snapshot_observed_at":"2026-08-01T18:54:52.804286Z","title":"arXiv preprint arXiv:2310.01469 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:52.804286Z"},"links":{"cited_paper":"/paper/2310.01469","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:210558c9f378b10b44c817ea0603b505fc0b21d0f6330b4aae0200cb508f89d0","observation_id":"e1afd918-d576-4d97-b909-ecaba04672d1","resolution":{"observed_at":"2026-08-01T18:54:52.804286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17436","last_updated":"2024-08-05T18:12:27Z","snapshot_observed_at":"2026-08-17T08:29:30.886066Z","submitted_at":"2024-07-11T21:16:48Z","title":"AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17436","snapshot_observed_at":"2026-08-01T18:54:52.928929Z","title":"arXiv preprint arXiv:2407.17436 , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:52.928929Z"},"links":{"cited_paper":"/paper/2407.17436","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:10f786623d7ba305a46b7f05d5d746f22bd9dae31d146bbcaa51a66560e161c4","observation_id":"7c3bdb28-b686-421f-ac4d-5bb66a412136","resolution":{"observed_at":"2026-08-01T18:54:52.928929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-08-16T13:11:26.444085Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-01T18:54:53.054207Z","title":"arXiv preprint arXiv:2410.06172 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.054207Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:b1f25c2618d0c42b15ff6b93156466946c3b53f8208179092669cc277320d815","observation_id":"89767f0f-59e4-4f9b-8fc7-a2ffc0dc38e9","resolution":{"observed_at":"2026-08-01T18:54:53.054207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10694","last_updated":"2025-04-14T20:30:41Z","snapshot_observed_at":"2026-08-16T12:41:09.495405Z","submitted_at":"2025-04-14T20:30:41Z","title":"The Jailbreak Tax: How Useful are Your Jailbreak Outputs?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10694","snapshot_observed_at":"2026-08-01T18:54:53.171272Z","title":"arXiv preprint arXiv:2504.10694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.171272Z"},"links":{"cited_paper":"/paper/2504.10694","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:792842ba7dac0c01136b5623e1f551d1e69968b3ede1552297ccf62337507652","observation_id":"967d7966-324c-44d1-abd9-4920a7cb276b","resolution":{"observed_at":"2026-08-01T18:54:53.171272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11668","last_updated":"2025-02-03T09:25:08Z","snapshot_observed_at":"2026-08-16T13:42:12.142311Z","submitted_at":"2024-06-17T15:51:01Z","title":"\"Not Aligned\" is Not \"Malicious\": Being Careful about Hallucinations of Large Language Models' Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11668","snapshot_observed_at":"2026-08-01T18:54:53.295354Z","title":"Not Aligned","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.295354Z"},"links":{"cited_paper":"/paper/2406.11668","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:696937ad86a512ad0d9d61ef8d17b80aa3c0ae6e2dc753024d29e111528e942a","observation_id":"7104ac5d-abc2-4143-99b7-f91bcc176f93","resolution":{"observed_at":"2026-08-01T18:54:53.295354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:53.455230Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.455230Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:3769a1b49c8cb8827d1f241c63e13566d40e6147f14b82102740552117e2810d","observation_id":"12eeab7a-76cb-43ea-810f-b49b34b23d8d","resolution":{"observed_at":"2026-08-01T18:54:53.455230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:53.564076Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.564076Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:1afa5c8e91f526bece9ea0523448cf40a73505456596f61b176fb56d266de24c","observation_id":"8971f3d3-dace-45e6-a8cd-216a155e3ebb","resolution":{"observed_at":"2026-08-01T18:54:53.564076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:53.703136Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.703136Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:89dff82f9423be32f748732dcbfd482ffef21e880435c80c73f3a94034a66ae1","observation_id":"963f3aaf-ca90-4070-af10-6a0f2444964d","resolution":{"observed_at":"2026-08-01T18:54:53.703136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:53.827434Z","title":"33rd USENIX Security Symposium (USENIX Security 24) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.827434Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:45dca05b200b98020db213b817e412e642837a09bd6678b29129b84240e5051f","observation_id":"d18954ac-a5c4-445f-925e-04e051baeb71","resolution":{"observed_at":"2026-08-01T18:54:53.827434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-01T18:54:53.960533Z","title":"arXiv preprint arXiv:2307.15043 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:53.960533Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:1a5fe83dc36e01e9464f4fa1fe8a7efb3266ee6cf355e8b2265566b4a48a51c6","observation_id":"2daa9fdb-a5dd-411a-b9b3-680399d26b00","resolution":{"observed_at":"2026-08-01T18:54:53.960533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:54.084873Z","title":"2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.084873Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:58b95789851e0709e8cd6540b64b156672b09615a8467d3bb820aec8dfbddcad","observation_id":"e7abd134-6d0c-436a-8bca-6f55970e726f","resolution":{"observed_at":"2026-08-01T18:54:54.084873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:54.215365Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.215365Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:88a66d36ffe826ec59ed273e7be0f55535b17c0c802dd98bba12dee1e3efa08a","observation_id":"74e2fb86-80b9-4124-ac9c-322e00e414e4","resolution":{"observed_at":"2026-08-01T18:54:54.215365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-01T18:54:54.352289Z","title":"arXiv preprint arXiv:2404.02151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.352289Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:640fab08161faa4181dbf66256c834d1b889891af4f4347243277b8973da8cba","observation_id":"8cc89bc9-ae29-4864-8b67-7c4d443dfd22","resolution":{"observed_at":"2026-08-01T18:54:54.352289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08715","last_updated":"2023-10-25T07:30:51Z","snapshot_observed_at":"2026-08-16T15:15:58.700562Z","submitted_at":"2023-07-16T01:07:15Z","title":"MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08715","snapshot_observed_at":"2026-08-01T18:54:54.483085Z","title":"arXiv preprint arXiv:2307.08715 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.483085Z"},"links":{"cited_paper":"/paper/2307.08715","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:7d3d0c59a0aeba45366e8dbf7fa44e1805f8e3b2a397c388249be6d46aa84ac5","observation_id":"fe62a189-eca0-4386-96c1-2a54cc8a66c3","resolution":{"observed_at":"2026-08-01T18:54:54.483085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-01T18:54:54.604317Z","title":"arXiv preprint arXiv:2310.04451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.604317Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:9be1e7b935ba269629577776fda8688408c12c7c9a660b7eba808272e778877c","observation_id":"a516a966-e485-483f-a54b-8edf16232ae1","resolution":{"observed_at":"2026-08-01T18:54:54.604317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:54.734577Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.734577Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:bb2ea96e1bf254c2326ebc21564fe41ee04b3023c0d7ab8ee505c1c32c8b601b","observation_id":"f761a488-706d-41aa-b7b8-a32b2dff86de","resolution":{"observed_at":"2026-08-01T18:54:54.734577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-08-15T18:47:46.763989Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-01T18:54:54.885903Z","title":"arXiv preprint arXiv:2310.06987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:54.885903Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:c8e1b2e66f57d04834b52c9c766edc3d16b1b44d6054f8842f64507e894eb09b","observation_id":"bb9a97c1-7f8f-4af3-b18f-f5ae0787f806","resolution":{"observed_at":"2026-08-01T18:54:54.885903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-08-16T14:23:07.919279Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-01T18:54:55.053927Z","title":"arXiv preprint arXiv:2401.17256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.053927Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:73d6e67a19d262a72e426fd160d2082b582ef3a26ab6f42289a2cabafcb42a1e","observation_id":"52fadcb1-083a-450b-ba00-b19f4d4df369","resolution":{"observed_at":"2026-08-01T18:54:55.053927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-01T18:54:55.186195Z","title":"arXiv preprint arXiv:2404.16873 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.186195Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:9243b46e949c1e9f816df2201a3f517553c083443e36d00c10d33ded51a91ee4","observation_id":"634f7881-0dcc-477c-b3cc-0de8ad8bb93e","resolution":{"observed_at":"2026-08-01T18:54:55.186195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21018","last_updated":"2024-06-05T16:35:49Z","snapshot_observed_at":"2026-08-16T13:47:20.509713Z","submitted_at":"2024-05-31T17:07:15Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21018","snapshot_observed_at":"2026-08-01T18:54:55.306378Z","title":"arXiv preprint arXiv:2405.21018 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.306378Z"},"links":{"cited_paper":"/paper/2405.21018","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:89a3433324f4a809112ad8986163360026d5b756b420ce13f43d645b1d39bbdc","observation_id":"ee5f4810-1ec9-4d50-b3aa-eebb2220b798","resolution":{"observed_at":"2026-08-01T18:54:55.306378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:55.442444Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.442444Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:84b7aee2dee128e13722cf9889461279932e5e45df708dc96a9b2aa8df7a5fbb","observation_id":"bac4df12-24e3-4676-83c9-33794bd5fab2","resolution":{"observed_at":"2026-08-01T18:54:55.442444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:55.544716Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.544716Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:5afc9fecbab8a985238783439d24e59bd172ce9cb9b2fdaa2c2d0364b3ec8872","observation_id":"58d8a426-7b61-4a49-b511-3bdb7575b589","resolution":{"observed_at":"2026-08-01T18:54:55.544716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:55.610459Z","title":"Edward Suh and Yevgeniy Vorobeychik and Zhuoqing Mao and Somesh Jha and Patrick McDaniel and Huan Sun and Bo Li and Chaowei Xiao , booktitle=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.610459Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:4a21bad08a31f75be7271028d101ad081e54a211065d2d66354ddbb221d45cb8","observation_id":"2cf06490-76ad-4784-9219-b3c6069fff03","resolution":{"observed_at":"2026-08-01T18:54:55.610459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:55.678718Z","title":"2018 , eprint=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.678718Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:933b820cad6abc28fa4ef23e2b3a84047b26397c627a4d5f73ac7c28beae0b20","observation_id":"3cdea44b-aaf9-4245-82ce-4fc125db9ddf","resolution":{"observed_at":"2026-08-01T18:54:55.678718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:55.797068Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.797068Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:a111f9385d1144d9dcc6b58cf5401f668787f145e8bf9b4669decfaf7ae6bd27","observation_id":"aac44d2d-62ff-4b5a-b33a-0efd711ba92e","resolution":{"observed_at":"2026-08-01T18:54:55.797068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:55.870808Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.870808Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:72d055e6dd22cbeaeb80bd24cb0b2dc77b527d078805709c63bdd7dd9bfd463a","observation_id":"138d8da7-079f-4616-af3e-0e4f7f0f4f31","resolution":{"observed_at":"2026-08-01T18:54:55.870808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-01T18:54:55.935710Z","title":"arXiv preprint arXiv:1909.08593 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:55.935710Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:ac1b461f669dd9cf0dc738a35a94531c385c736538e692df2cba1dc8fbcd2200","observation_id":"8ba6f0e7-97e4-4c31-932b-baaf6070ab1f","resolution":{"observed_at":"2026-08-01T18:54:55.935710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-12T17:45:10.384900Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04295","snapshot_observed_at":"2026-08-01T18:54:56.006123Z","title":"arXiv preprint arXiv:2407.04295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.006123Z"},"links":{"cited_paper":"/paper/2407.04295","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:c21771e821e2a236b17903783e6ee49cb3808542f395e698974ab301b555110b","observation_id":"24f8ae2d-9fce-46cc-b4ab-41964e720e21","resolution":{"observed_at":"2026-08-01T18:54:56.006123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.071336Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.071336Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:7a9b60dec22dc72d85d600094994e427b8640cc2880be08cc8dfac11a33d0505","observation_id":"33f297fe-3784-4bbc-abb0-e779cb68245c","resolution":{"observed_at":"2026-08-01T18:54:56.071336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.181744Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.181744Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:fe701e68d9680c4c61b25b0f0e01bf83b1180d9995f25f0d130382d384084acd","observation_id":"6bcb71d8-d5bc-434f-abc4-4fea114ae1a6","resolution":{"observed_at":"2026-08-01T18:54:56.181744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02574","snapshot_observed_at":"2026-08-01T18:54:56.256964Z","title":"arXiv preprint arXiv:2503.02574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.256964Z"},"links":{"cited_paper":"/paper/2503.02574","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:54b389edaa2cf012fcc2cde92aa1221f0890d08d87805e5d4c8f58ede0792b6f","observation_id":"e4bc5f1f-d17b-4223-864c-af779694ee32","resolution":{"observed_at":"2026-08-01T18:54:56.256964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05922","last_updated":"2023-09-12T02:34:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-12T02:34:06Z","title":"A Survey of Hallucination in Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05922","snapshot_observed_at":"2026-08-01T18:54:56.305693Z","title":"arXiv preprint arXiv:2309.05922 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.305693Z"},"links":{"cited_paper":"/paper/2309.05922","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:38abce1aecad4d1dee1a69fd878ebe43495c3f3986f33ef5b0287bc8c626e44b","observation_id":"7870a03d-dc66-4da8-8a26-13a488e66d5c","resolution":{"observed_at":"2026-08-01T18:54:56.305693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.364474Z","title":"ACM Transactions on Information Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.364474Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:0e0acc7847d797d2c139bd240bed2eb026c4ecc7c10624048ce989e962f0f325","observation_id":"ea86d252-d43c-4c70-bd5d-ca91156f2953","resolution":{"observed_at":"2026-08-01T18:54:56.364474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-08-16T12:38:46.158503Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-01T18:54:56.415531Z","title":"arXiv preprint arXiv:2309.01219 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.415531Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:e959b08ab6b90df7b9fb7eefdf92e9fd786cc757b530cf89950b6c2f5a99d0ca","observation_id":"7ae36b45-8dd6-4030-b929-9faba43241e6","resolution":{"observed_at":"2026-08-01T18:54:56.415531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.514885Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.514885Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:180f99beedb38296e7e86fc35cc9b91e20e1a545bf1f0a55bef6a2180767c829","observation_id":"c1f2901e-acff-42b6-b9bb-c522c5a80d7a","resolution":{"observed_at":"2026-08-01T18:54:56.514885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-01T18:54:56.575779Z","title":"arXiv preprint arXiv:2404.01318 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.575779Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:a1caadf839e04ddc2e556278a2fa4f676dc0c93027df99de9204713bd634f152","observation_id":"b430ccb1-6a13-4671-825e-1544dd768caa","resolution":{"observed_at":"2026-08-01T18:54:56.575779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09321","last_updated":"2025-02-04T16:04:22Z","snapshot_observed_at":"2026-08-16T13:43:15.198180Z","submitted_at":"2024-06-13T16:59:43Z","title":"JailbreakEval: An Integrated Toolkit for Evaluating Jailbreak Attempts Against Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09321","snapshot_observed_at":"2026-08-01T18:54:56.625375Z","title":"arXiv preprint arXiv:2406.09321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.625375Z"},"links":{"cited_paper":"/paper/2406.09321","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:8f7fcbef5748c9301eb225d37f40d8fac7aef69df7ce80610a447cf1b5a09d9a","observation_id":"4c7e6fec-e06b-48d0-92d1-2ce08b9f29de","resolution":{"observed_at":"2026-08-01T18:54:56.625375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.682990Z","title":"NeurIPS 2024 Competition Track , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.682990Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:034f8fa98d2ebae47287ed28a1bfee0186553cbeb75b763da1d8de97ac3c12c4","observation_id":"0f559ffc-5998-47bf-9b49-9a3f6b9aec65","resolution":{"observed_at":"2026-08-01T18:54:56.682990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06407","last_updated":"2024-05-07T14:06:23Z","snapshot_observed_at":"2026-08-16T14:02:20.901924Z","submitted_at":"2024-04-09T15:54:16Z","title":"Rethinking How to Evaluate Language Model Jailbreak","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06407","snapshot_observed_at":"2026-08-01T18:54:56.732635Z","title":"arXiv preprint arXiv:2404.06407 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.732635Z"},"links":{"cited_paper":"/paper/2404.06407","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:ec39f936f7c3e1d848e34ccc0ed82f077dd1e3d02c576d733b1d726ced580f4c","observation_id":"cf882857-a8cc-4cca-82a7-b80739ec12f0","resolution":{"observed_at":"2026-08-01T18:54:56.732635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.829238Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.829238Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:ed22edb6e1d15335207643f12e6dda6160856c9474620f830f3c61b664e40ce1","observation_id":"03044fc8-b0f7-4f87-8616-0f7d5c19e5bf","resolution":{"observed_at":"2026-08-01T18:54:56.829238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:56.917242Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:56.917242Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:f8bcd20f7ba5d2c486d8fc2f6a2ec693ae2bd76410a1f4c5b221e5ee7a563972","observation_id":"d4e22f94-39ae-4794-9235-9c4b44865aee","resolution":{"observed_at":"2026-08-01T18:54:56.917242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:57.009764Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.009764Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:485b6352a7af7eef233a4cee58fa0de73b9c94ff6d6682eb466c77ca2a607657","observation_id":"e6e2d029-4e1d-4555-909a-f4d2750d635e","resolution":{"observed_at":"2026-08-01T18:54:57.009764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-01T18:54:57.057116Z","title":"arXiv preprint arXiv:2309.10253 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.057116Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:662bded2b0558e2ad8bbab79f8d3056f6ae815ff5bba36af8c27233e3624708e","observation_id":"bb7d12f4-52e4-4dce-8a41-62bcee50f814","resolution":{"observed_at":"2026-08-01T18:54:57.057116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21038","last_updated":"2025-08-25T20:17:00Z","snapshot_observed_at":"2026-08-16T05:47:55.681314Z","submitted_at":"2025-04-28T07:38:43Z","title":"Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21038","snapshot_observed_at":"2026-08-01T18:54:57.117807Z","title":"arXiv preprint arXiv:2504.21038 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.117807Z"},"links":{"cited_paper":"/paper/2504.21038","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:4db0e085fee6a2834d46e032375351d367dbf39ddffb7bb7c7aa7c9ec3a0709c","observation_id":"3406f3d7-d8c9-4e94-8c11-f3745de7deff","resolution":{"observed_at":"2026-08-01T18:54:57.117807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14598","last_updated":"2025-03-01T21:45:36Z","snapshot_observed_at":"2026-08-17T11:35:24.473105Z","submitted_at":"2024-06-20T17:56:07Z","title":"SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14598","snapshot_observed_at":"2026-08-01T18:54:57.199932Z","title":"arXiv preprint arXiv:2406.14598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.199932Z"},"links":{"cited_paper":"/paper/2406.14598","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:f70312a53790dfb73ffd5c84200cf079839539301d659471f44b01d39fe0d4ef","observation_id":"0d12b4db-f03f-48e6-83eb-facc8d89715b","resolution":{"observed_at":"2026-08-01T18:54:57.199932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-01T18:54:57.280117Z","title":"arXiv preprint arXiv:2402.10260 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.280117Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:f2429ccd190179a292c29424fe5eb6c554de93a47b12b8d199ff09edaa358488","observation_id":"a1bb377c-d590-423c-bf0e-15187944036b","resolution":{"observed_at":"2026-08-01T18:54:57.280117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:57.338164Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.338164Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:2e218f402aade252325c5fa772075ddf352ee4cdf0593b6c6124eab515afcb84","observation_id":"7742f2ee-ca4d-4638-82e5-45b309e1d408","resolution":{"observed_at":"2026-08-01T18:54:57.338164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:57.407015Z","title":"The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.407015Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:fb13dfa68aa7301f997e14f06a60299a94d23a0a068564732b0c9d7be7834c24","observation_id":"adf2f54f-3431-4866-8881-f12569d34608","resolution":{"observed_at":"2026-08-01T18:54:57.407015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-01T18:54:57.490593Z","title":"arXiv preprint arXiv:2109.07958 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.490593Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:bf7bf06c11c2ff9a740d9ebbe5b50741cf6f54b6e0f94979126f96999f9e3560","observation_id":"ab5d1d69-c259-4ad9-8662-d6e660ffc989","resolution":{"observed_at":"2026-08-01T18:54:57.490593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-08-14T03:34:08.418318Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23278","snapshot_observed_at":"2026-08-01T18:54:57.589967Z","title":"arXiv preprint arXiv:2503.23278 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.589967Z"},"links":{"cited_paper":"/paper/2503.23278","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:ac9c072dd8849831ff312b3aca5f6d5767a10079fd9595007b242387fe41728b","observation_id":"69ef5eac-fa14-4423-82d8-da73b3f6e575","resolution":{"observed_at":"2026-08-01T18:54:57.589967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06474","last_updated":"2024-03-04T04:03:54Z","snapshot_observed_at":"2026-08-16T14:53:31.129213Z","submitted_at":"2023-10-10T09:44:06Z","title":"Multilingual Jailbreak Challenges in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06474","snapshot_observed_at":"2026-08-01T18:54:57.637430Z","title":"arXiv preprint arXiv:2310.06474 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.637430Z"},"links":{"cited_paper":"/paper/2310.06474","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:77d2a54bc81c4876aa85941a97ba95bffc3758938418b372d3df03353680484d","observation_id":"4088aabc-2307-467f-8a8a-d350cbac629f","resolution":{"observed_at":"2026-08-01T18:54:57.637430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:57.720048Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.720048Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:8a4894f91289ffb36ad028e781bd77a8b56922c2279cb7df050ff5365c873115","observation_id":"754b9883-c0c1-4889-9df2-8d64b1689f7a","resolution":{"observed_at":"2026-08-01T18:54:57.720048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-16T13:44:42.428829Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-01T18:54:57.776258Z","title":"arXiv preprint arXiv:2406.05946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.776258Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:4409184189011a66d9f95f9de1dc25206809c497555cb9876f8fc2c79bb5443a","observation_id":"e94f6a3c-d03e-4e58-8f17-d7a4b741ab86","resolution":{"observed_at":"2026-08-01T18:54:57.776258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:57.831509Z","title":"ACM Transactions on Knowledge Discovery from Data , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.831509Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:e843f45b0b12a2dc703b03eba2449aa92701a255380e0d496249eb697973deca","observation_id":"5650bd3f-f3ef-4e01-9f12-a203a04b2d32","resolution":{"observed_at":"2026-08-01T18:54:57.831509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:57.913572Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.913572Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:e6d675c69330a69d57e9488dd3ec5bbaaefba60c2ba46f1f5cb935b199186a59","observation_id":"b2aaa0d2-6ef4-4a4a-a0ec-07d9dfee04ad","resolution":{"observed_at":"2026-08-01T18:54:57.913572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18105","last_updated":"2024-04-01T18:47:45Z","snapshot_observed_at":"2026-08-17T01:36:16.854923Z","submitted_at":"2024-03-26T21:04:29Z","title":"Large Language Models for Education: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18105","snapshot_observed_at":"2026-08-01T18:54:57.992768Z","title":"arXiv preprint arXiv:2403.18105 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:57.992768Z"},"links":{"cited_paper":"/paper/2403.18105","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:6cca0cf1414cb4cdd4dd285abd958731b5c674a567ee2069461b40e420f81bf8","observation_id":"390f0c41-6019-48cc-895d-beb02767722d","resolution":{"observed_at":"2026-08-01T18:54:57.992768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.067412Z","title":"Informatics , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.067412Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:72b1df348e03b399dea7fed4a1280eea02e44dd0059acc71b358ca71150af5c0","observation_id":"aeef9f0d-8016-4b8a-9ebb-db11e3b5e7e7","resolution":{"observed_at":"2026-08-01T18:54:58.067412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.133388Z","title":"Authorea preprints , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.133388Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:f42a3eaf32347f4799194b536b8d98e42cff71a19dc0b6da5dfd6f0690d0a0c0","observation_id":"5ee1f032-12a6-4a78-b728-c3a0956cd609","resolution":{"observed_at":"2026-08-01T18:54:58.133388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-01T18:54:58.218018Z","title":"arXiv preprint arXiv:2406.00515 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.218018Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:535c78d49c6aff1609a0e3f3c6a46df15af62be2271b4f2e246a101d29a19b71","observation_id":"f2d6e1fd-df4c-46c2-b21b-bd20a6992d6d","resolution":{"observed_at":"2026-08-01T18:54:58.218018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.276090Z","title":"Findings of the association for computational linguistics: ACL 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.276090Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:9643a5c65459b6afc9ed64f565e037ba392bab686a077d4728539c6c3bef10bf","observation_id":"ce426873-190a-4a13-b211-ac2dc8f6daed","resolution":{"observed_at":"2026-08-01T18:54:58.276090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T18:54:58.373783Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.373783Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:c590d312982e77b2a7872621bdb7acc6899e06deedbe1615dc9538caa90dd1ea","observation_id":"daf1f126-3b89-4513-9613-6bd799100796","resolution":{"observed_at":"2026-08-01T18:54:58.373783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.432299Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.432299Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:afd5acc44d63416444b7853f3936a993f42dc8a841af9beb395d40ea8bccb8e2","observation_id":"9ad09991-2733-4a69-b2d2-1394c071c5d2","resolution":{"observed_at":"2026-08-01T18:54:58.432299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.533335Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.533335Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:94009550a4c024acc005ba3b3a591fab213bb402f593852274072eeb5e801cbe","observation_id":"748335bd-f319-4e63-88f2-f636cba9aaba","resolution":{"observed_at":"2026-08-01T18:54:58.533335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T18:54:58.636508Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.636508Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:590c3cdc4f88bc01ebc2f83799eefa917aa798ab859353460bd80d2bc3c1cd56","observation_id":"222983a9-cc05-42b4-9c64-782afc464c71","resolution":{"observed_at":"2026-08-01T18:54:58.636508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.717021Z","title":"SafeWork-R1: Coevolving Safety and Intelligence under the AI-45\\^","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.717021Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:7770e0b305fa6b612701d6d3e7620cd1b1875f65eb0150f12d9d5bdf0ec7d4f8","observation_id":"dbeede4c-e780-46e5-a574-0617323ee4a2","resolution":{"observed_at":"2026-08-01T18:54:58.717021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17805","last_updated":"2025-01-29T17:47:36Z","snapshot_observed_at":"2026-08-15T14:15:35.328292Z","submitted_at":"2025-01-29T17:47:36Z","title":"International AI Safety Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17805","snapshot_observed_at":"2026-08-01T18:54:58.799632Z","title":"arXiv preprint arXiv:2501.17805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.799632Z"},"links":{"cited_paper":"/paper/2501.17805","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:d4fda19994725a565714be7d03100b003d472a11985370aa80ae1dc841f263c7","observation_id":"56b24cb1-7064-471a-b02b-00add06844b8","resolution":{"observed_at":"2026-08-01T18:54:58.799632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-01T18:54:58.879692Z","title":"arXiv preprint arXiv:2108.07258 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.879692Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:5227cf8440c9037afb604f308321e161e793b96748edc5b9e96e1672de14b730","observation_id":"5d63aebd-b504-4428-95cc-ce8752d04fa0","resolution":{"observed_at":"2026-08-01T18:54:58.879692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:58.951261Z","title":"URL: https://nvlpubs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:58.951261Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:0cf043a7761e8736f4a50fb39fcd312c85455b2af6a437fba9d82c0d4991e041","observation_id":"1e66d62e-529c-48a2-a58f-e1cdf6c721cb","resolution":{"observed_at":"2026-08-01T18:54:58.951261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.008206Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.008206Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:125803bd7484245e3d901a86543a6ec614bf0cd49cf22ae25ef57a3836cc0ef0","observation_id":"b360ee57-36a2-46cb-a833-06da870baba3","resolution":{"observed_at":"2026-08-01T18:54:59.008206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.080115Z","title":"Official Journal of the European Union , number =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.080115Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:b8c45bd5ca988971c792073526dd120c11c09a9b4c4bed90eb1f52cc77cf374c","observation_id":"5a9c45d4-ddc9-43c1-b98c-8c06f7769717","resolution":{"observed_at":"2026-08-01T18:54:59.080115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-01T18:54:59.137059Z","title":"arXiv preprint arXiv:1606.06565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.137059Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:0712c87dab77911005233c6dd08fbad6dff5ef26ab26530ad145c5ed4cf4bd29","observation_id":"9be8b5df-975c-4dd8-a686-e3653d6ddfc2","resolution":{"observed_at":"2026-08-01T18:54:59.137059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09023","last_updated":"2025-10-10T05:51:04Z","snapshot_observed_at":"2026-08-15T07:47:42.680001Z","submitted_at":"2025-10-10T05:51:04Z","title":"The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09023","snapshot_observed_at":"2026-08-01T18:54:59.205593Z","title":"arXiv preprint arXiv:2510.09023 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.205593Z"},"links":{"cited_paper":"/paper/2510.09023","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:d203c422863103fefa2c8a138c3d20bd6b6c79e0ef1f792fbaa0bc5c5dd71eb9","observation_id":"8efbc6e0-74c3-459c-b776-130303cc9bc7","resolution":{"observed_at":"2026-08-01T18:54:59.205593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.285088Z","title":"2023 , institution =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.285088Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:83b0dff0e252813a3fa64fe19d3068ef0abc3144c1ec3990106ca4910c4b3e25","observation_id":"8a135a9f-d109-49df-a0f2-92f3f064bc7f","resolution":{"observed_at":"2026-08-01T18:54:59.285088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.361896Z","title":"2024 , institution =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.361896Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:eb9779e25886eb3e3274cf90adf6392a5c482f9f7d38888a52c1f2dc7ebd4431","observation_id":"6daa9d79-8d71-45f1-9aa5-e15c3f669de0","resolution":{"observed_at":"2026-08-01T18:54:59.361896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.435844Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.435844Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:cf5da488eb7bff7b7d75fb5587830da5748c6b5a07004e299c2c198037ed7acd","observation_id":"e9a03aee-bca8-498b-8f50-d160eccb2051","resolution":{"observed_at":"2026-08-01T18:54:59.435844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.503198Z","title":"Learning and individual differences , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.503198Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:9b600b3c9774a6b332e1c7ff4b280754f7fc4fd43b932f981805e1eedf891e7b","observation_id":"c47077ed-cc0a-4a6e-ab67-b7481b5059b4","resolution":{"observed_at":"2026-08-01T18:54:59.503198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.565923Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.565923Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:b42ce9848699fbac60d7379cfc136a190d37ecc6ba9d1003fb539f08688f08c4","observation_id":"52cf64d8-cd5a-4dd9-9a07-e7b62e2ba3eb","resolution":{"observed_at":"2026-08-01T18:54:59.565923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.639381Z","title":"Proceedings of the 2020 conference on empirical methods in natural language processing (EMNLP) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.639381Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:599ebeaab4fd2d0cc48b75288e1076a4dc67ca9b79f070aa0d2894a9168694c5","observation_id":"ac885b44-caf0-485b-9938-a7ba948372cc","resolution":{"observed_at":"2026-08-01T18:54:59.639381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.694477Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.694477Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:6454b70e2762d7c6695659ea64628543640e11470293adc02f960f248568a43e","observation_id":"47d6f59f-5d31-4646-b257-d3685c254a71","resolution":{"observed_at":"2026-08-01T18:54:59.694477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.767550Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.767550Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:249faa921ff68077aa15725762b43396d2a49d1e44c0a418c6727995ef0711dd","observation_id":"70d3e225-4228-4e19-918b-1865550ba9d4","resolution":{"observed_at":"2026-08-01T18:54:59.767550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-01T18:54:59.849263Z","title":"arXiv preprint arXiv:2207.05221 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.849263Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:f86d02afb7cf525008d6d58f51ed042bf843f7dd76f72f1f1547c8651117fad0","observation_id":"58efd87a-497f-4f7a-898b-ddab44108a5a","resolution":{"observed_at":"2026-08-01T18:54:59.849263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-01T18:54:59.925943Z","title":"arXiv preprint arXiv:2302.09664 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.925943Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:4f21f2c825a6daf4a9a77e6f4d9304251ae8535de16cb5491f4ad684af65aeb3","observation_id":"d73020be-2075-43d4-ad95-feb6caa8cbdc","resolution":{"observed_at":"2026-08-01T18:54:59.925943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:54:59.998324Z","title":"British journal of applied science & technology , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T18:54:59.998324Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:0c28026ba6565ef6686ddd23d4a0d6829ec76f22bea42fb18519a9f00cdde2d9","observation_id":"458a7d69-d789-4a61-a49b-fe9a906afcfc","resolution":{"observed_at":"2026-08-01T18:54:59.998324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.088094Z","title":"arXiv preprint arXiv:2407.14937 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.088094Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:e6c11ce1846b698747771f4fed6f096aa09c627c90ae75d2665bba04c858def0","observation_id":"c43fb9e4-383d-4975-95c1-0bff492d3ee3","resolution":{"observed_at":"2026-08-01T18:55:00.088094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.167017Z","title":"arXiv preprint arXiv:2507.04446 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.167017Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:85bcd638ab602b2b46b334fcf8fdfeb0755737f2bb553638456b1532b661cd26","observation_id":"bfbada33-5f0b-4969-87a0-b359b19dae5a","resolution":{"observed_at":"2026-08-01T18:55:00.167017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T18:55:00.240230Z","title":"arXiv preprint arXiv:2303.08774 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.240230Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:acc5c61fb2e1453dfb0d04604d47e7061478c7ba9c0159e6df9102bd94a18694","observation_id":"0ad08a4e-0b2d-4ac9-919b-4fc516602ed0","resolution":{"observed_at":"2026-08-01T18:55:00.240230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.313906Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.313906Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:c849f881a9a3b706b4461925ca79292101e414655974de7d42aa64f4ea24da60","observation_id":"05f7f820-9b95-4e06-9a9c-b267f1078fe3","resolution":{"observed_at":"2026-08-01T18:55:00.313906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.401032Z","title":", author=","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.401032Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:5ea62ffadef26207ae3d3085cd6880686a786efd66f05611403688d9dbb8ca6c","observation_id":"cf244df0-50a8-4695-bd2d-cc95f8f3808b","resolution":{"observed_at":"2026-08-01T18:55:00.401032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.513630Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.513630Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:bc753b7dfa4368e5acb9a6c3aaa5a71c4b7277a9ae35c26bfc54c0311de65463","observation_id":"bcdf61de-112d-4b06-b144-6634ddf5c162","resolution":{"observed_at":"2026-08-01T18:55:00.513630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.587989Z","title":"IEEE Transactions on Human-Machine Systems , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.587989Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:790b26bde59b270652641d261dc90c036d7491ae4b9f89236e9ade8df51e2060","observation_id":"1e0546cb-6f39-425c-8ec2-c63d1bd82928","resolution":{"observed_at":"2026-08-01T18:55:00.587989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.647582Z","title":"Policy sciences , volume=","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.647582Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:b7f107789e71949b08671f2bc0b868e4d91997c6aee0aceda67e469a48a16f3f","observation_id":"a7830ed4-96ab-45c9-a058-429e7f379557","resolution":{"observed_at":"2026-08-01T18:55:00.647582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-01T18:55:00.756145Z","title":"arXiv preprint arXiv:2402.04249 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.756145Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:eed17e5646526985ec377fd7422222398bc64c02859f1b701ff3e335d95e6057","observation_id":"b86df9b2-6a42-4a2d-a482-a313c3bc73ed","resolution":{"observed_at":"2026-08-01T18:55:00.756145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-01T18:55:00.841653Z","title":"arXiv preprint arXiv:2309.00614 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.841653Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:9aaaa21a45eb7afb188439de1e835d0a1e4661dbd11a31befc6cd12af890234a","observation_id":"bffa723a-232d-49f6-8515-ba6ec89e3f6b","resolution":{"observed_at":"2026-08-01T18:55:00.841653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:00.925825Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:00.925825Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:4da48e3ce962ea563a8e24a1f9674a53fcda6ed2748da911cca10efaf546ef47","observation_id":"fb3ccb79-5d81-4b5c-b4aa-5eeb3d941e82","resolution":{"observed_at":"2026-08-01T18:55:00.925825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:55:01.007366Z","title":"arXiv preprint arXiv:2601.10543 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:01.007366Z"},"links":{"citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:60fc492b301b1bbfe4f46e03f3681bd497acb11e3781434db0615813f62fa2df","observation_id":"c312933b-1446-44d6-9d18-e3fe0bef0a34","resolution":{"observed_at":"2026-08-01T18:55:01.007366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-16T14:53:33.115609Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-01T18:55:01.084617Z","title":"arXiv preprint arXiv:2310.06387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T18:55:01.084617Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2607.17152"},"observation_digest":"sha256:aa04864cb482ac5c77830993f0aece0d0c36b788d9bcc2f8aed0515682f11323","observation_id":"dde8f715-429a-4a7b-a486-671e594e1b93","resolution":{"observed_at":"2026-08-01T18:55:01.084617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17152","last_updated":"2026-07-19T09:18:35Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T14:18:14.468847Z","submitted_at":"2026-07-19T09:18:35Z","title":"How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":138},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 138 outbound references and 0 inbound Pith citation observations for arXiv:2607.17152."}