{"as_of":"2026-08-10T10:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3db8432c712a65232407a2bc659faa977dd6a69f853fb9f4d42197399210686","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:12:04.882237Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:50:11.090116Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T09:48:31.721745Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2310.08419"},"observation_digest":"sha256:290245ff0facc1fc7c97813ce6f92dc951ef6303db852f62af3346361f52c2bb","observation_id":"048aaf97-31c3-4526-bfc8-a3773f238a7e","resolution":{"observed_at":"2026-05-12T09:48:33.242823Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2312.03853","last_updated":"2026-04-30T10:23:33Z","snapshot_observed_at":"2026-07-06T16:57:59.000365Z","submitted_at":"2023-12-06T19:07:38Z","title":"Dr. Jekyll and Mr. Hyde: Two Faces of LLMs","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T05:05:35.726118Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2312.03853"},"observation_digest":"sha256:21126a3554b917efd3110eadfe8ab2c901a0b7468e7cd9bd67b18c14d2357e03","observation_id":"84096182-e022-4442-8f53-f1c2d080ab13","resolution":{"observed_at":"2026-05-24T05:06:00.350340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T21:28:02.745230Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2402.10260"},"observation_digest":"sha256:de4236886a380d1562545ef098e013d1055a01ff7d4ef13d7d4c548ea4600bcb","observation_id":"49b0f1a6-1594-49cc-b309-7617cf3e94c1","resolution":{"observed_at":"2026-05-16T21:28:02.861882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-15T06:08:05.386345Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2404.01318"},"observation_digest":"sha256:3fab8988de83d31c43ef70a7986e9a6f7a5d52b6a973121eb69f437fd636eca8","observation_id":"dc4002bc-dea2-4b34-b549-7dd66ece4c54","resolution":{"observed_at":"2026-05-15T06:08:05.480000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:829b2b71ef5a1d7fb504b192886c1651aa04f0e4a5dbc0d6439f6d774bb904ec","observation_id":"db505cbd-6cd1-4674-8b49-730762ea7099","resolution":{"observed_at":"2026-05-15T02:20:44.811573Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-10T00:12:04.882237Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18280","last_updated":"2025-05-17T04:37:43Z","snapshot_observed_at":"2026-08-10T03:17:04.804861Z","submitted_at":"2025-01-30T11:37:40Z","title":"Jailbreaking LLMs' Safeguard with Universal Magic Words for Text Embedding Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T00:12:04.882237Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2501.18280"},"observation_digest":"sha256:02bc58df0bdbb3b9cb904e0c13cc4e9652dda6f6aac8c9c1dcef9ecd761d46b2","observation_id":"941745b9-75cd-4f8c-9a7d-aa987e2725d1","resolution":{"observed_at":"2026-08-10T00:12:04.882237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-09T19:14:53.721398Z","title":"8 Xinyue Shen, Zeyuan Chen, Michael Backes, Yun Shen, and Yang Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00406","last_updated":"2025-07-08T15:49:01Z","snapshot_observed_at":"2026-08-09T19:05:49.739014Z","submitted_at":"2025-02-01T11:45:44Z","title":"Agents Are All You Need for LLM Unlearning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T19:14:53.721398Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2502.00406"},"observation_digest":"sha256:d0db593687e8bd83139c92ede19301528c997718f9f0ce741d4f296473b3bab9","observation_id":"3d848e5d-3895-4631-9e7a-b58f4573cde8","resolution":{"observed_at":"2026-08-09T19:14:53.721398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-09T16:28:54.094781Z","title":"do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01154","last_updated":"2025-02-03T08:44:24Z","snapshot_observed_at":"2026-08-09T16:20:42.073459Z","submitted_at":"2025-02-03T08:44:24Z","title":"Jailbreaking with Universal Multi-Prompts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T16:28:54.094781Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2502.01154"},"observation_digest":"sha256:f5b191034645902f5268248daa4cb2802c60dee0c7fcc7307f75da820efeed18","observation_id":"836769b0-789b-45a2-aa2e-1c59c43e35f4","resolution":{"observed_at":"2026-08-09T16:28:54.094781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-09T12:47:21.758202Z","title":"S calable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02260","last_updated":"2026-06-02T17:48:48Z","snapshot_observed_at":"2026-08-09T12:42:57.704129Z","submitted_at":"2025-02-04T12:17:08Z","title":"Position: Adversarial ML for LLMs Is Not Making Any Progress","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T12:47:21.758202Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2502.02260"},"observation_digest":"sha256:f4d20477f344ff4165644932aeb6aad3bbe6134a2a9609ed57a47d7dc9f572fc","observation_id":"fc1c11dd-ec9f-45ee-8622-dd26f0a580b0","resolution":{"observed_at":"2026-08-09T12:47:21.758202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T20:46:15.926339Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09723","last_updated":"2025-05-26T10:35:21Z","snapshot_observed_at":"2026-08-09T04:16:19.111417Z","submitted_at":"2025-02-13T19:13:03Z","title":"QueryAttack: Jailbreaking Aligned Large Language Models Using Structured Non-natural Query Language","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:46:15.926339Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2502.09723"},"observation_digest":"sha256:b4dfab08183691d76fa0549d4169ffcbd6dda2c1155c174782ecb40fed95894a","observation_id":"76c2f389-29c0-4cc6-9ff1-f7d42a703277","resolution":{"observed_at":"2026-08-07T20:46:15.926339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T14:00:07.771929Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:07.771929Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:8c430021cef8b65fc3bba00ed53e0eae0e7e77a75ea9204f29d392b16025cb33","observation_id":"e4c1861b-9875-4628-86e9-e6c8780e54de","resolution":{"observed_at":"2026-08-07T14:00:07.771929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T13:21:44.924826Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22037","last_updated":"2025-05-28T06:59:46Z","snapshot_observed_at":"2026-08-07T13:14:20.687450Z","submitted_at":"2025-05-28T06:59:46Z","title":"Jailbreak Distillation: Renewable Safety Benchmarking","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:44.924826Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2505.22037"},"observation_digest":"sha256:bfca43faa1b5b452072f5fdca9ebe34046ce25c09d3484ff35debc86d184e89e","observation_id":"995c9188-0317-4fba-a6a0-834c209a5684","resolution":{"observed_at":"2026-08-07T13:21:44.924826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T11:11:40.530536Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation.arXiv preprint arXiv:2311.03348, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-09T00:38:29.639641Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.530536Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:79e1f25488e4bec3c525ed427c330a2d6730bfa8ac69a2206c8c45920efb115a","observation_id":"3c0bbdf6-817c-4bd0-a666-601b851f6a74","resolution":{"observed_at":"2026-08-07T11:11:40.530536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T10:17:26.883048Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-07T10:11:06.747781Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.883048Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:10df89aefd23ba7ce38336499c46c2b6d9351adf5cf1f43652a74ee4b2705bf2","observation_id":"3c351043-6e22-4ba2-8063-e415567b38df","resolution":{"observed_at":"2026-08-07T10:17:26.883048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-07T00:51:15.645320Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12707","last_updated":"2025-06-15T03:39:13Z","snapshot_observed_at":"2026-08-10T10:13:26.110622Z","submitted_at":"2025-06-15T03:39:13Z","title":"SecurityLingua: Efficient Defense of LLM Jailbreak Attacks via Security-Aware Prompt Compression","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:51:15.645320Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.12707"},"observation_digest":"sha256:455daf90c6d1b67c16be08abe6494e348ac4603268745d5b10e3e4e43186e4c1","observation_id":"4caf03b7-64e8-467e-aa4e-56422e420bb6","resolution":{"observed_at":"2026-08-07T00:51:15.645320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T23:20:55.859123Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation.arXiv preprint arXiv:2311.033482023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.859123Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:55395a8647d7ea934597a2c6f72c75ff951f32d0f2ceae1fd15fb8efa910b851","observation_id":"6d906230-1a4e-4b3f-b9a8-854bff233fbf","resolution":{"observed_at":"2026-08-06T23:20:55.859123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T22:07:04.720473Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation.arXiv preprint arXiv:2311.03348, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22666","last_updated":"2026-05-30T16:23:21Z","snapshot_observed_at":"2026-08-06T21:58:37.734178Z","submitted_at":"2025-06-27T22:22:00Z","title":"VERA: Variational Inference Framework for Jailbreaking Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:07:04.720473Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.22666"},"observation_digest":"sha256:599103b8dd4c09d88dfab9ff42059cb7e259c86171fdf66e1c55acf508ac1429","observation_id":"5942f2a1-cda5-4fab-8a27-6ec6c3c2b392","resolution":{"observed_at":"2026-08-06T22:07:04.720473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T21:27:34.985261Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00239","last_updated":"2025-06-30T20:13:49Z","snapshot_observed_at":"2026-08-08T11:00:52.585789Z","submitted_at":"2025-06-30T20:13:49Z","title":"Linearly Decoding Refused Knowledge in Aligned Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:34.985261Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.00239"},"observation_digest":"sha256:22574099aeeb0ee0d256dfe7d3a09588a884d01a81d5397257591349b96aa022","observation_id":"74e33e9a-f10b-4f6d-88cb-9af4f587b0f0","resolution":{"observed_at":"2026-08-06T21:27:34.985261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T17:35:48.436360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14202","last_updated":"2025-07-14T17:41:12Z","snapshot_observed_at":"2026-08-08T03:22:49.699348Z","submitted_at":"2025-07-14T17:41:12Z","title":"PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T17:35:48.436360Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.14202"},"observation_digest":"sha256:cc42e84010ceb7be2cde85d154245b7158a363d8b961168ec5afdb46ba7cf71e","observation_id":"b853babb-024f-485f-bda8-0d6e9d553ba5","resolution":{"observed_at":"2026-08-06T17:35:48.436360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T14:45:20.550173Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17922","last_updated":"2025-07-23T20:39:14Z","snapshot_observed_at":"2026-08-10T04:04:43.274309Z","submitted_at":"2025-07-23T20:39:14Z","title":"From Seed to Harvest: Augmenting Human Creativity with AI for Red-teaming Text-to-Image Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:45:20.550173Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.17922"},"observation_digest":"sha256:e5ab61882c9988e65b45bce3fd21bdfff163a79f05960f5546a85a702bb46be5","observation_id":"02860e26-ed0f-46bf-9da8-bf95f39ad648","resolution":{"observed_at":"2026-08-06T14:45:20.550173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T14:17:34.120945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19598","last_updated":"2025-07-25T18:11:10Z","snapshot_observed_at":"2026-08-08T09:36:36.194652Z","submitted_at":"2025-07-25T18:11:10Z","title":"MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T14:17:34.120945Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2507.19598"},"observation_digest":"sha256:af7343aad2aa9d5a7f45f5acdc33b15acd2a9ffa968e3e417d715a8ad2986162","observation_id":"5bb6def3-2f52-4d35-8150-66280a73bd78","resolution":{"observed_at":"2026-08-06T14:17:34.120945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T00:59:42.029495Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.03986","last_updated":"2025-08-06T00:39:28Z","snapshot_observed_at":"2026-08-07T09:03:43.592840Z","submitted_at":"2025-08-06T00:39:28Z","title":"The Emotional Baby Is Truly Deadly: Does your Multimodal Large Reasoning Model Have Emotional Flattery towards Humans?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T00:59:42.029495Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2508.03986"},"observation_digest":"sha256:016dd0ea53270da2bc29ecd0d5f913d6551761520ba66fb4d5b07d0f6c7a72dc","observation_id":"c0049bed-32c9-4638-81e1-7145f1c03b4c","resolution":{"observed_at":"2026-08-06T00:59:42.029495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-05T20:31:41.745657Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-08T02:31:17.622343Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.745657Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:f0b5cb600f0787c0fbd7a0cbb03f6d67a367efe9f0249aef6d9f82a57d01e4cb","observation_id":"1a625e3c-4afa-4f3b-b1e3-eb81901693df","resolution":{"observed_at":"2026-08-05T20:31:41.745657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-05T16:00:48.913381Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:48.913381Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:aeb57b409e07cd3954e1e9171856475b96e699601a6a91f00b0e4afeb9410ce9","observation_id":"25ebd5fc-712f-4be4-8ac9-6177452bcd62","resolution":{"observed_at":"2026-08-05T16:00:48.913381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2508.20325","last_updated":"2026-05-11T14:12:43Z","snapshot_observed_at":"2026-07-06T22:19:48.389341Z","submitted_at":"2025-08-28T00:07:10Z","title":"GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T21:34:51.665401Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2508.20325"},"observation_digest":"sha256:76fc640e4a3ae993178ae08c78702df78fb0e19ff655bc34d9bb9b976f5a1a62","observation_id":"51bae0dc-effd-4724-9804-6e3ad33b4bdb","resolution":{"observed_at":"2026-05-18T21:36:52.516771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2509.06701","last_updated":"2026-05-12T03:07:08Z","snapshot_observed_at":"2026-07-06T22:25:53.156731Z","submitted_at":"2025-09-08T13:55:01Z","title":"Probabilistic Modeling of Latent Agentic Substructures in Deep Neural Networks","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T18:25:25.751119Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2509.06701"},"observation_digest":"sha256:750bf681901a19986e16840721208910311a8b7454380ed0c8a906bdd9170877","observation_id":"e652e991-c4d7-451c-a0bf-7f831e253e4a","resolution":{"observed_at":"2026-05-18T18:26:43.700266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2601.03416","last_updated":"2026-04-16T05:44:02Z","snapshot_observed_at":"2026-07-06T22:40:56.386532Z","submitted_at":"2026-01-06T21:09:10Z","title":"GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T17:04:53.839154Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2601.03416"},"observation_digest":"sha256:e1f292059eaf17068388ef588cfa9986c8febe645667def7771cbabe5410b598","observation_id":"6fcd0746-d538-4497-a298-36eeebcd2e89","resolution":{"observed_at":"2026-05-16T17:08:08.260439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2602.11528","last_updated":"2026-04-18T03:07:48Z","snapshot_observed_at":"2026-07-06T22:45:34.674215Z","submitted_at":"2026-02-12T03:37:50Z","title":"Stop Tracking Me! Proactive Defense Against Attribute Inference Attack in LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T05:22:59.050348Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2602.11528"},"observation_digest":"sha256:64e5f9a2fa5e6d0000f2558cace6aba889d5a938ddbd4fe2cb3e2e099a32ea28","observation_id":"b1f54b27-8df9-45c9-bd09-5e105446ab8f","resolution":{"observed_at":"2026-05-16T05:27:23.199273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-02T18:15:27.401675Z","title":"org/CorpusID:268856920","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.15684","last_updated":"2026-07-29T08:22:26Z","snapshot_observed_at":"2026-08-02T18:15:25.250934Z","submitted_at":"2026-03-15T12:13:01Z","title":"State-Dependent Safety Failures in Multi-Turn Language Model Interaction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T18:15:27.401675Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2603.15684"},"observation_digest":"sha256:109785f15c2c9775113ff91331ed78f755a0dec435f911f58bc832b64874c079","observation_id":"8cb8c199-c5ba-41cb-8c8e-6b0e44334727","resolution":{"observed_at":"2026-08-02T18:15:27.401675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2604.09750","last_updated":"2026-04-10T11:44:57Z","snapshot_observed_at":"2026-08-03T01:32:17.065525Z","submitted_at":"2026-04-10T11:44:57Z","title":"Conflicts Make Large Reasoning Models Vulnerable to Attacks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:24:25.255602Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2604.09750"},"observation_digest":"sha256:9fea77f0cee2d10bff5eac16d3dd718663d6ff25370623dfb9fab52c27c706f5","observation_id":"56730341-2f6b-4825-99bc-171d507ae8ff","resolution":{"observed_at":"2026-05-11T06:51:46.135021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2604.10733","last_updated":"2026-04-12T17:12:55Z","snapshot_observed_at":"2026-07-06T22:59:18.756089Z","submitted_at":"2026-04-12T17:12:55Z","title":"Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T16:05:09.033412Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2604.10733"},"observation_digest":"sha256:d48530f76931bc0df560e9d44b1bef7c405258466b9b69d6447d83213520e692","observation_id":"7f80a41d-4886-426a-9dd5-1acd3c6d89a2","resolution":{"observed_at":"2026-05-11T09:21:00.947468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2604.14548","last_updated":"2026-04-20T07:51:45Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T02:24:59Z","title":"VoxSafeBench: Not Just What Is Said, but Who, How, and Where","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T10:19:28.041282Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2604.14548"},"observation_digest":"sha256:c4906ac93b9cc7391518e164455bb643c515da77a320001bff32bf34e5d572c6","observation_id":"92b5cdac-c2c9-4c7f-a753-0cf32915931b","resolution":{"observed_at":"2026-05-10T10:24:21.983100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2605.01899","last_updated":"2026-05-03T14:28:08Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:28:08Z","title":"Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T17:24:54.796037Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2605.01899"},"observation_digest":"sha256:402a07d729684ddb431849256014d10ae3a40b11a4a64968ce556919d479ca07","observation_id":"0cf46a83-bcf0-4960-99a5-9c5e20c551b4","resolution":{"observed_at":"2026-05-11T16:21:07.539243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2605.05116","last_updated":"2026-05-06T16:47:07Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:47:07Z","title":"On the Hardness of Junking LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T17:38:32.028947Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2605.05116"},"observation_digest":"sha256:fb369211bbc379411d7bd89357a0142c54c61c3bebd550f8b6315a0281f7fdec","observation_id":"429303f9-8b9c-40b1-bb68-8dd7a4bfb69a","resolution":{"observed_at":"2026-05-11T17:21:10.199160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2605.24279","last_updated":"2026-05-22T23:13:21Z","snapshot_observed_at":"2026-07-31T10:30:03.841807Z","submitted_at":"2026-05-22T23:13:21Z","title":"ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T15:17:37.904831Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2605.24279"},"observation_digest":"sha256:7887648ce672d01e156f5354faaf8b43dc60f6e5d1c67fec1a91eafa49bcaaed","observation_id":"02566d56-245c-4f38-abd7-e26852bcab41","resolution":{"observed_at":"2026-06-30T15:34:48.461754Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2606.00801","last_updated":"2026-05-30T16:40:24Z","snapshot_observed_at":"2026-08-04T17:47:17.706554Z","submitted_at":"2026-05-30T16:40:24Z","title":"Quality-Diversity Evolution for Discovering Diverse Vulnerabilities in LLM Safety","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T18:33:58.265424Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2606.00801"},"observation_digest":"sha256:d9d45aa941a33788d2205d38305794fe0b3ad743c4f7a82c890a9b89ce2381db","observation_id":"0fe7bbb2-338d-4b87-bf0e-a68e330e07ff","resolution":{"observed_at":"2026-06-28T20:32:37.942834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2606.05523","last_updated":"2026-06-04T00:06:13Z","snapshot_observed_at":"2026-08-08T00:57:41.523461Z","submitted_at":"2026-06-04T00:06:13Z","title":"CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T02:34:26.334078Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2606.05523"},"observation_digest":"sha256:c15f93b8e62c4dbfc12d77cacde37db45c5ce042b9208cd3a89f0482a9debab3","observation_id":"ad43cf6e-9b85-4c0a-8d00-384d15da4c5e","resolution":{"observed_at":"2026-07-02T12:06:55.661342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2606.05609","last_updated":"2026-06-04T02:31:29Z","snapshot_observed_at":"2026-08-05T14:48:48.513078Z","submitted_at":"2026-06-04T02:31:29Z","title":"SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T01:16:07.252429Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2606.05609"},"observation_digest":"sha256:c9e95cb5291788daf15ee8c8458b9d7f3ab6301778f1aa0e19c11702f9580e67","observation_id":"7e0f354e-5d7b-471a-b39d-e07f8a5b6c28","resolution":{"observed_at":"2026-07-02T13:26:59.288656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2606.25476","last_updated":"2026-07-21T11:09:35Z","snapshot_observed_at":"2026-08-06T23:05:07.064301Z","submitted_at":"2026-06-24T07:00:53Z","title":"A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-25T20:58:53.119386Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2606.25476"},"observation_digest":"sha256:18b9237e53805d88f12b0cff57f08dfb25160cfa39328160b46aa65c8ba90b5d","observation_id":"ee858e8a-052b-4b27-921c-038480946b72","resolution":{"observed_at":"2026-07-04T19:50:11.091665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-02T10:16:38.894699Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.25476","last_updated":"2026-07-21T11:09:35Z","snapshot_observed_at":"2026-08-06T23:05:07.064301Z","submitted_at":"2026-06-24T07:00:53Z","title":"A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T10:16:38.894699Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2606.25476"},"observation_digest":"sha256:b259c87582e67545ede380cb3197f2332ea5190dceedf0d245b80d7b4b8bc12b","observation_id":"3f5ce316-7ac9-4e84-bc73-956f6b4b9924","resolution":{"observed_at":"2026-08-02T10:16:38.894699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":"2311.03348","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-04T19:50:11.090116Z","title":"arXiv preprint arXiv:2311.03348 (2023)","venue":null,"work_id":"ae0f14e0-eb2e-4516-b895-79c9b5a2cc0d","year":2023},"citing_paper":{"arxiv_id":"2607.01277","last_updated":"2026-07-01T06:36:29Z","snapshot_observed_at":"2026-08-05T18:03:53.977353Z","submitted_at":"2026-07-01T06:36:29Z","title":"Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-03T20:38:16.610310Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2607.01277"},"observation_digest":"sha256:ebe0321eee0327c824d8cc829a466d188d281cf3e2d75e840430d1106a71f8bf","observation_id":"54147477-564f-43bc-b241-f968bbf1548c","resolution":{"observed_at":"2026-07-03T20:38:54.949070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-07-12T05:44:33.099337Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation , publisher =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02972","last_updated":"2026-07-03T05:28:43Z","snapshot_observed_at":"2026-08-06T03:26:39.939878Z","submitted_at":"2026-07-03T05:28:43Z","title":"A Scalable Approach to Evaluating Moral Sensitivity in LLMs","version":1},"reference_index":157,"source":"arxiv_source","source_observed_at":"2026-07-12T05:44:33.099337Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2607.02972"},"observation_digest":"sha256:aa43050f25cdc04107c46b80f93c4e4b57659adff0270d757b9e7989f556e055","observation_id":"10a14e1f-2063-4e44-93e4-a61675755567","resolution":{"observed_at":"2026-07-12T05:44:33.099337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-02T12:39:56.982241Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22569","last_updated":"2026-06-01T04:20:25Z","snapshot_observed_at":"2026-08-10T06:52:15.193794Z","submitted_at":"2026-06-01T04:20:25Z","title":"Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T12:39:56.982241Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2607.22569"},"observation_digest":"sha256:7f6a8d5225dec9dc68b97bbd0384a68c231349832987b46f8ca0a3f279a9dc25","observation_id":"0ae2cb66-26b5-46ae-99e1-d23cfab18d5b","resolution":{"observed_at":"2026-08-02T12:39:56.982241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-04T01:44:31.810386Z","title":"Scalable and","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00023","last_updated":"2026-08-06T06:50:50Z","snapshot_observed_at":"2026-08-09T23:10:00.882725Z","submitted_at":"2026-07-09T22:07:27Z","title":"Role Steering of Language Models for Social Simulations","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T01:44:31.810386Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2608.00023"},"observation_digest":"sha256:e107e786325e047fa08a2c096e81dc0b3840879016f5a77a913fe24ed6ca5bcd","observation_id":"39690abe-ff05-411e-9ae9-0698e268e704","resolution":{"observed_at":"2026-08-04T01:44:31.810386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.03348/citation-record","integrity":"/paper/2311.03348/integrity","json":"/paper/2311.03348/citation-record.json","paper":"/paper/2311.03348"},"outbound":[],"paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 44 inbound Pith citation observations for arXiv:2311.03348."}